🔍 چطور دقت پاسخ‌دهی هوش مصنوعی را به سطح انسانی برسانیم؟ معرفی «Gamut»!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا امروز تمرکز اکثر ارزیابی‌های هوش مصنوعی روی «صحت» پاسخ‌ها بوده، اما یک جای کار می‌لنگید: «کامل بودن» اطلاعات! 📝

محققان به تازگی چارچوب جدیدی به نام Gamut (Grounded Assessment of Multimodal Factuality) را معرفی کرده‌اند. این ابزار دو مرحله‌ای، ابتدا اهمیت اطلاعات را دسته‌بندی کرده و سپس آن را به چک‌لیست‌های دقیق تبدیل می‌کند تا مدل‌های هوش مصنوعی نه تنها درست، بلکه کامل و جامع پاسخ دهند. این متدولوژی با استفاده از داده‌های دنیای واقعی (مبتنی بر تصاویر)، قدم بزرگی برای ارزیابی دقیق‌تر مدل‌های زبانی بزرگ (LLM) است. 🧠✨

منبع: arXiv NLP