محققان در مقالهای جدید به بررسی چالشهای ارزیابی LLMها پرداختهاند. از آنجایی که تست کردن مدلهای بزرگ بسیار هزینهبر است، روشهایی برای کاهش دادههای تست و پیشبینی عملکرد (Benchmark Prediction) ابداع شده است.
نکته جالب این تحقیق اینجاست که بسیاری از روشهای پیچیده فعلی، در واقع عملکرد بهتری از یک مدل رگرسیون ساده روی نمونههای تصادفی ندارند! همچنین مشخص شد که این مدلهای پیشبینی، در مواجهه با مدلهای بسیار پیشرفتهتر از آنچه قبلاً دیدهاند، دچار مشکل میشوند.
این تحقیق نشان میدهد که دنیای ارزیابی هوش مصنوعی هنوز به راهکارهای علمیتر و دقیقتری برای مدیریت منابع نیاز دارد.
منبع: arXiv Machine Learning
