📸 پایان «توهم» در مدل‌های بینایی-زبانی با فریم‌ورک EVisRAG!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از مشکلات بزرگ مدل‌های بینایی-زبانی (VLM)، «توهم‌های بصری» یا همان گزارش اطلاعات اشتباه از تصاویر است. محققان به تازگی فریم‌ورک جدیدی به نام EVisRAG معرفی کرده‌اند که با استفاده از «شواهد بصری هدایت‌شده»، دقت این مدل‌ها را در تحلیل تصاویر به طرز چشمگیری بالا می‌برد.

این سیستم با شناسایی شواهد مرتبط از تصاویر متعدد و ترکیب آن‌ها با یک روش آموزشی بهینه، نه تنها توهم‌های بصری را کاهش می‌دهد، بلکه دقت مدل‌ها را در پاسخ به سوالات بصری تا ۱۹ درصد بهبود بخشیده است. گام بزرگی برای هوش مصنوعی که می‌خواهد دنیا را دقیق‌تر ببیند! 🚀🧠

منبع: arXiv Computer Vision