تا امروز تمرکز اکثر ارزیابیهای هوش مصنوعی روی «صحت» پاسخها بوده، اما یک جای کار میلنگید: «کامل بودن» اطلاعات! 📝
محققان به تازگی چارچوب جدیدی به نام Gamut (Grounded Assessment of Multimodal Factuality) را معرفی کردهاند. این ابزار دو مرحلهای، ابتدا اهمیت اطلاعات را دستهبندی کرده و سپس آن را به چکلیستهای دقیق تبدیل میکند تا مدلهای هوش مصنوعی نه تنها درست، بلکه کامل و جامع پاسخ دهند. این متدولوژی با استفاده از دادههای دنیای واقعی (مبتنی بر تصاویر)، قدم بزرگی برای ارزیابی دقیقتر مدلهای زبانی بزرگ (LLM) است. 🧠✨
منبع: arXiv NLP
