یکی از مشکلات بزرگ مدلهای بینایی-زبانی (VLM)، «توهمهای بصری» یا همان گزارش اطلاعات اشتباه از تصاویر است. محققان به تازگی فریمورک جدیدی به نام EVisRAG معرفی کردهاند که با استفاده از «شواهد بصری هدایتشده»، دقت این مدلها را در تحلیل تصاویر به طرز چشمگیری بالا میبرد.
این سیستم با شناسایی شواهد مرتبط از تصاویر متعدد و ترکیب آنها با یک روش آموزشی بهینه، نه تنها توهمهای بصری را کاهش میدهد، بلکه دقت مدلها را در پاسخ به سوالات بصری تا ۱۹ درصد بهبود بخشیده است. گام بزرگی برای هوش مصنوعی که میخواهد دنیا را دقیقتر ببیند! 🚀🧠
منبع: arXiv Computer Vision
