محققان به تازگی بنچمارک جدیدی به نام FindStatBench را برای ارزیابی توانایی مدلهای زبانی بزرگ (LLM) در «سنتز کد ترکیبیاتی» (Combinatorial Code Synthesis) معرفی کردهاند. این بنچمارک با بیش از ۲۳۰۰ تسک ریاضی، مدلها را به چالش میکشد تا بدون استفاده از ابزارهای کمکی یا بازخورد اجرا، کدهای دقیق تولید کنند.
نکته جالب اینجاست که نتایج اولیه نشان میدهد افزودن مثال به پرامپتها همیشه به نفع مدل نیست و گاهی حتی باعث کاهش دقت آنها میشود! همچنین این مطالعه تفاوت معناداری در عملکرد مدلها در مسائل «سنتز آماری» و «سنتز نگاشت» نشان داده است که مسیر را برای بهبود استدلال کدنویسی در آینده هموارتر میکند.
نویسی
منبع: arXiv AI
