🧠 ارتقای یادگیری مدل‌های زبانی با متد نوین «Self-Review»

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک دستاورد تازه، چارچوب جدیدی به نام SRRL را معرفی کرده‌اند که یادگیری تقویتی (RL) در مدل‌های زبانی را متحول می‌کند. برخلاف روش‌های معمول که در محیط‌های دارای بازخورد تأخیری به مشکل می‌خورند، این روش با گنجاندن یک مرحله «خود-نقد» (Self-Review) در هر مرحله، به مدل کمک می‌کند خطاهای خود را ریشه‌یابی کرده و در تلاش‌های بعدی، عملکرد خود را بهبود ببخشد.

نکته کلیدی اینجاست که این مدل‌ها نه تنها اشتباهاتشان را تحلیل می‌کنند، بلکه این اصلاحات را در حافظه بلندمدت خود ذخیره کرده و به دانش عمومی مدل تبدیل می‌کنند. نتایج تست‌ها روی مدل‌های Qwen و OLMo نشان‌دهنده افزایش چشمگیر دقت و بهره‌وری در حل مسائل منطقی است.

منبع: arXiv AI