مدلهای بزرگ بینایی-زبانی (LVLM) با وجود توانمندیهای خیرهکنندهشان، هنوز با مشکل «توهم» (Hallucination) یا تولید محتوای نامرتبط با تصویر دستوپنجه نرم میکنند.
محققان به تازگی فریمورک جدید و جذابی به نام SeeMe را معرفی کردهاند که به جای تغییر در فرآیند تولید متن، روی «مهندسی ویژگیهای بصری» تمرکز دارد. این متد با بازسازی توکنهای بصری و حذف نویزها، به مدل کمک میکند فقط روی دادههای واقعی و دقیق تمرکز کند. خبر خوب این است که SeeMe نیازی به آموزش مجدد ندارد و نتایج تستها روی بنچمارکهای معروفی مثل MME نشان داده که به طرز چشمگیری باعث افزایش دقت و ثبات پاسخهای مدل میشود.
این نوآوری گامی رو به جلو برای هوشمندتر و قابلاعتمادتر شدن هوش مصنوعی در درک دنیای واقعی است. 🚀
منبع: arXiv AI
