امروزه برای سنجش توانمندی مدلهای زبانی بزرگ (LLM)، از روشهای آماری پیچیدهای مثل «نظریه پاسخ به سوال» یا همان IRT استفاده میشود؛ اما یک پژوهش جدید نشان میدهد که این روشها لزوماً برای دنیای مدلهای هوش مصنوعی طراحی نشدهاند!
محققان در این مطالعه بررسی کردند که چگونه تفاوتهای ساختاری بین آزمونهای انسانی و بنچمارکهای هوش مصنوعی (مثل تعداد مدلها و توزیع دادهها) میتواند باعث ایجاد نتایج نادرست یا غیرقابلاعتماد در رتبهبندی مدلها شود. به زبان ساده، اگر معیارهای اندازهگیریمان دقیق نباشد، ممکن است در تشخیص «هوش واقعی» مدلها دچار خطا شویم.
این تحقیق هشدار میدهد که باید در تفسیر نتایج بنچمارکها محتاطتر باشیم و به دنبال روشهای ارزیابی مقیاسپذیر و دقیقتری بگردیم.
منبع: arXiv AI
