مدلهای زبانی «انتشار ماسکشده» (MDLM) به رقیبی جدی برای مدلهای زبانی معمولی تبدیل شدهاند، اما یک مشکل بزرگ وجود دارد: استانداردهای ارزیابی! 📉
محققان در مقاله جدیدی، فریمورک «CaRE» را معرفی کردهاند که به ما کمک میکند بفهمیم آیا بهبود نتایج این مدلها واقعاً ناشی از هوشِ الگوریتم است یا فقط به خاطر تنظیمات متفاوت در ارزیابی! این مطالعه نشان میدهد که با تغییر معیارهایی مثل «دما» (Temperature) و «تعداد مراحل»، رتبهبندی مدلها کاملاً تغییر میکند. این دستاورد گامی مهم برای استانداردسازی و شفافیت بیشتر در دنیای هوش مصنوعی است. 🤖💡
منبع: arXiv AI
