تا حالا به این فکر کردید که چطور مدلهای زبانی (LLM) در برنامهنویسی ارزیابی میشوند؟ پژوهشگران در یک بررسی جامع روی ۶۷۲ بنچمارک کُد، به نتایج تأملبرانگیزی رسیدند: با وجود پیشرفتهای چشمگیر، هنوز استانداردهای «دقت»، «قابلیت اطمینان» و «تکرارپذیری» در بسیاری از این آزمونها نادیده گرفته میشوند!
محققان برای حل این مشکل، راهنمای جدیدی به نام HOW2BENCH با ۵۵ چکلیست کاربردی معرفی کردند تا توسعهدهندگان بتوانند مدلهای هوش مصنوعی را با استانداردهای علمیتر و دقیقتری بسنجند. به نظر شما، آیا وقت آن نرسیده که در دنیای هوش مصنوعی، کیفیت ارزیابیها را همتراز با سرعتِ رشد مدلها افزایش دهیم؟
منبع: arXiv AI
