مدلهای زبانی چندوجهی (MLLM) همیشه در توصیف دقیق تصاویر عالی عمل نمیکردند و گاهی دچار خطا میشدند. حالا محققان با معرفی بنچمارک جدید GranFact و روشی نوین در بهینهسازی ترجیحات، راهکاری پیدا کردهاند که مدلها یاد بگیرند تا کجا میتوانند در توصیف تصاویر دقیق باشند بدون اینکه کیفیت و درستی خروجی قربانی شود. این یعنی گامی مهم به سوی هوش مصنوعیِ قابلاطمینانتر و دقیقتر در تحلیلهای بصری! 🧠✨
منبع: arXiv Computer Vision
