تا به حال دقت کردهاید که معیارهای قدیمی ارزیابی مدلهای زبانی (مثل روشهای لغوی) چقدر محدود هستند؟ این روشها اغلب نمیتوانند تفاوت بین توانایی حل مسئله مدل و صرفاً رعایت فرمتهای نوشتاری را تشخیص دهند.
محققان در پژوهشی جدید، رویکرد «BERT-as-a-Judge» را معرفی کردند که یک جایگزین سبک و دقیق برای ارزیابی مدلهای زبانی است. این ابزار بدون نیاز به منابع محاسباتی سنگین (که در روشهای LLM-as-a-Judge میبینیم)، میتواند درستی پاسخها را بهخوبیِ مدلهای بزرگتر ارزیابی کند. این پیشرفت میتواند سرعت و دقت توسعه و انتخاب مدلهای هوش مصنوعی را به شدت بهبود ببخشد.
منبع: arXiv AI
