محققان در دستاورد جدیدی، مفهوم «تأیید و راستیآزمایی» را به عنوان محور جدیدی برای افزایش دقت مدلهای زبانی (LLM) معرفی کردهاند.
این چارچوب نوآورانه به مدل اجازه میدهد بدون نیاز به آموزش مجدد، با استفاده از امتیازدهی احتمالی (به جای امتیازدهی قطعی)، بازخوردهای بسیار دقیقتری درباره درستی پاسخهایش ارائه دهد. این یعنی دقت بالاتر در حل مسائل پیچیده و وظایف عاملمحور (Agentic tasks)!
نتایج اولیه این مدل در بنچمارکهای معتبری مثل SWE-Bench، عملکردی خیرهکننده را نشان داده است.
منبع: arXiv AI
