محققان در مقاله جدیدی، متد نوآورانهای به نام CoRT را معرفی کردهاند که مشکل رایج تخصیص «پاداش» در آموزش مدلهای زبانی را حل میکند. در روشهای فعلی (مثل GRPO)، پاداشها بهصورت کلی به کل پاسخ اختصاص مییابند، اما CoRT با استفاده از «بازپخشِ پادواقعی» (Counterfactual Replay)، مشخص میکند کدام بخش از متن تولید شده دقیقاً مستحق دریافت امتیاز مثبت است.
نتایج نشان میدهد که این رویکرد بدون نیاز به مدلهای کمکی پیچیده، دقت مدلها را به شکل قابلتوجهی افزایش میدهد. گام دیگری به سوی مدلهای زبانی دقیقتر و قابلاعتمادتر! 🤖✨
منبع: arXiv AI



