محققان در مقالهی جدید خود، چارچوب نوآورانهای به نام MICA (مخفف Multi-granularity Intertemporal Credit Assignment) را معرفی کردهاند که مشکل بزرگ یادگیری تقویتی (RL) در مدلهای زبانی را هدف قرار داده است.
مشکل اصلی اینجاست که در گفتگوهای طولانی، مدلها در اختصاص امتیاز (Credit Assignment) به پاسخهای قبلی ضعیف عمل میکنند. اما با متد MICA، مدل بدون نیاز به سیستمهای پیچیده یا منتقد جداگانه، میتواند درک بسیار دقیقتری از پیامدهای هر پاسخ در طول مکالمه داشته باشد.
نتیجه این پژوهش، افزایش چشمگیر عملکرد مدلهای سری Qwen در بنچمارکهای گفتگوهای حمایتی (Emotional Support) است که نویدبخشِ ایجنتهایی با هوش عاطفی بالاتر و تعاملات انسانیتر است. 🤖💬
منبع: arXiv AI
