یکی از بزرگترین چالشهای مدلهای چندوجهی (MLLM)، «توهم» یا تولید اطلاعات نادرست است. محققان به تازگی کشف کردهاند که این توهمات شباهت زیادی به حواسپرتی در انسان دارند؛ جایی که تمرکز تقسیمشده باعث کاهش دقت در درک جزئیات میشود.
تکنیک جدیدی به نام AFIP (Attention-Focused Approach) معرفی شده که با اصلاح نحوه توجه مدل به بخشهای مختلف تصویر، بدون نیاز به آموزش مجدد، دقت مدل را به شدت بالا میبرد و خطاهای ادراکی را کاهش میدهد. این یعنی هوش مصنوعی در درک تصاویر دقیقتر و قابلاعتمادتر عمل خواهد کرد. 🤖✨
🔗 لینک پروژه: https://github.com/MIKUZ12/AFIP
منبع: arXiv Computer Vision
