🚀 بهینه‌سازی دقیق‌تر LLMها با روش جدید CoRT!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی، متد نوآورانه‌ای به نام CoRT را معرفی کرده‌اند که مشکل رایج تخصیص «پاداش» در آموزش مدل‌های زبانی را حل می‌کند. در روش‌های فعلی (مثل GRPO)، پاداش‌ها به‌صورت کلی به کل پاسخ اختصاص می‌یابند، اما CoRT با استفاده از «بازپخشِ پادواقعی» (Counterfactual Replay)، مشخص می‌کند کدام بخش از متن تولید شده دقیقاً مستحق دریافت امتیاز مثبت است.

نتایج نشان می‌دهد که این رویکرد بدون نیاز به مدل‌های کمکی پیچیده، دقت مدل‌ها را به شکل قابل‌توجهی افزایش می‌دهد. گام دیگری به سوی مدل‌های زبانی دقیق‌تر و قابل‌اعتمادتر! 🤖✨

منبع: arXiv AI