محققان در تحقیق جدیدی، رویکرد متفاوتی برای ارزیابی مدلهای زبانی ارائه دادند. تا امروز برای ارزیابی خروجی مدلها، ناچار بودیم از مدلهای بسیار بزرگ و هزینهبر (LLM-as-a-Judge) استفاده کنیم. اما حالا فریمورک جدیدی به نام «INSPECTOR» معرفی شده که با استفاده از «Representation-as-a-Judge»، به جای بررسی خروجیهای متنی، مستقیماً سراغ لایههای درونی و نهفته مدلهای کوچکتر میرود.
نتیجه؟ ارزیابی بسیار سریعتر، دقیقتر و ارزانتر که میتواند جایگزین مدلهای سنگین برای سنجش عملکرد هوش مصنوعی در مسائل پیچیده ریاضی و استدلال شود. این یعنی گامی بزرگ به سوی بهینهسازی و هوش مصنوعی دسترسپذیرتر! 🚀
منبع: arXiv Machine Learning
