🚀 چالش جدید برای مدل‌های زبانی: معرفی FindStatBench!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی بنچمارک جدیدی به نام FindStatBench را برای ارزیابی توانایی مدل‌های زبانی بزرگ (LLM) در «سنتز کد ترکیبیاتی» (Combinatorial Code Synthesis) معرفی کرده‌اند. این بنچمارک با بیش از ۲۳۰۰ تسک ریاضی، مدل‌ها را به چالش می‌کشد تا بدون استفاده از ابزارهای کمکی یا بازخورد اجرا، کدهای دقیق تولید کنند.

نکته جالب اینجاست که نتایج اولیه نشان می‌دهد افزودن مثال به پرامپت‌ها همیشه به نفع مدل نیست و گاهی حتی باعث کاهش دقت آن‌ها می‌شود! همچنین این مطالعه تفاوت معناداری در عملکرد مدل‌ها در مسائل «سنتز آماری» و «سنتز نگاشت» نشان داده است که مسیر را برای بهبود استدلال کدنویسی در آینده هموارتر می‌کند.

‌نویسی

منبع: arXiv AI