مدلهای بینایی-زبانی (LVLM) با وجود توانمندیهای فوقالعاده، هنوز یک نقطه ضعف بزرگ دارند: «توهم» یا همان تولید محتوای نامرتبط با تصویر! 🖼️
محققان در پژوهشی جدید، ریشه این مشکل را شناسایی کردند. آنها متوجه شدند که لایههای FFN در مدلها، گاهی دانش قبلی زبانی را به جای اطلاعاتِ بصریِ داخل تصویر، اولویت میدهند.
راهکار جدید آنها یعنی FADE، بدون نیاز به آموزش مجدد مدل، خروجی این لایهها را کنترل میکند تا هوش مصنوعی دقت بیشتری روی تصاویر داشته باشد و کمتر دچار اشتباه شود. این یعنی مدلهای بینایی-زبانی دقیقتر و هوشمندتر از همیشه! 🧠✨
منبع: arXiv AI
