همانطور که میدانید، ارزیابی مدلهای زبانی (LLM) در مسائل ریاضی همیشه چالشبرانگیز بوده است. محققان به تازگی چارچوب آماری جدیدی معرفی کردهاند که به جای تکیه صرف بر پاسخ نهایی (که ممکن است درست نباشد)، از «سیگنالهای مقایسهای» استفاده میکند.
این روش یعنی:
✅ مدلها یاد میگیرند که حتی وقتی پاسخ نهایی را نمیدانند، کدام استدلال منطقیتر است.
✅ کاهش چشمگیر خطا و نوسان در رتبهبندی مدلها.
✅ نتایج بسیار دقیقتر برای مدلهای زبانی در آزمونهای سخت مثل AIME و GPQA.
این نوآوری راه را برای ساخت بنچمارکهای هوشمندتر و ارزیابی عادلانهتر تواناییهای استدلالی مدلهای هوش مصنوعی باز میکند. آیندهی ارزیابی هوش مصنوعی بسیار دقیقتر از چیزی است که فکرش را میکنید! 🤖✨
منبع: arXiv AI
