محققان در دستاورد جدیدی، چارچوب هوشمندی به نام «Rubrics on Trial» را معرفی کردهاند که انقلابی در نحوه ارزیابی مدلهای زبانی بزرگ (LLM) ایجاد میکند.
مشکل اصلی اینجاست که تولید «روبیک» یا معیارهای ارزیابی توسط خود مدلها، همیشه دقیق نیست و گاهی استایلهای غیرضروری را به جای کیفیت اصلی پاسخ ارزیابی میکنند. این متد جدید، بدون نیاز به آموزش اضافی یا دادههای انسانی، با استفاده از جفت پاسخهای مصنوعی، معیارهای ارزیابی را تکامل میدهد تا فقط ویژگیهای کلیدی و واقعیِ پاسخها سنجیده شوند.
این تحقیق نشان میدهد که میتوان بدون صرف هزینههای سنگینِ نظارت انسانی، دقت ارزیابی مدلها را به شکل چشمگیری افزایش داد. 🚀
منبع: arXiv NLP
