محققان در یک دستاورد تازه، راهکاری نوآورانه برای رفع چالشهای یادگیری تقویتی (RL) در مدلهای زبانی بزرگ ارائه دادهاند. یکی از مشکلات اصلی در روشهای فعلی، ناتوانی مدل در یادگیری از معیارهای پیچیده (Rubric) است که منجر به هدر رفتن سیگنالهای آموزشی میشود.
مدل جدیدی به نام «CriPO» با استفاده از تکنیک «خود-تقطیری» (Self-Distillation)، نهتنها مسیر یادگیری را بهینهتر کرده، بلکه مشکل عدم تطابق آموزش و استنتاج را هم حل کرده است. این یعنی مدلهای هوش مصنوعی میتوانند در وظایف پیچیده و باز، دقیقتر و هوشمندتر عمل کنند. 🧠✨
منبع: arXiv AI
