🧠 روشی جدید برای ارزیابی هوش مصنوعی: وقتی مدل‌ها به مدل‌های دیگر امتیاز می‌دهند!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، چارچوب نوآورانه‌ای را برای سنجش مدل‌های زبانی بزرگ (LLM) معرفی کرده‌اند. در این روش، به جای تکیه بر معیارهای ثابت و سنتی، مدل‌ها با مشارکت در یک فرایند داوری گروهی، کیفیت پاسخ‌های یکدیگر را ارزیابی می‌کنند.

این رویکرد که بر پایه «اجماع» بنا شده، به‌جای تمرکز بر درستی مطلق، «ترجیحات نسبی» را می‌سنجد و شاخصی به نام RII (شاخص هوش نسبی) را ارائه می‌دهد تا مشخص شود کدام مدل‌ها پاسخ‌های مطلوب‌تری از نگاه سایر مدل‌ها تولید می‌کنند. این گام مهمی در درک بهترِ کیفیت پاسخ‌دهی هوش مصنوعی در محیط‌های پیچیده است.

منبع: arXiv NLP