🧠 رازِ «توجه» در مدل‌های بینایی-زبانی: آیا مدل‌های ما بیش از حد روی جزئیات متمرکز هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش تازه، معمای جالبی رو در مدل‌های بزرگ بینایی-زبانی (LVLM) حل کردند! آن‌ها متوجه شدند که «Attention Sink»ها یا همان توکن‌هایی که توجه زیادی رو به خودشون جذب می‌کنند، هم می‌تونن کمک‌کننده باشن (برای درک کلی صحنه) و هم دردسرساز (با نادیده گرفتن جزئیات دقیق).

در این مطالعه، یک تکنیک جدید به نام «LSG» معرفی شده که مثل یک دروازه‌بان هوشمند عمل می‌کنه و به مدل اجازه می‌ده تا تعادل بهتری بین دید کلی و دقت جزئیات برقرار کنه. نکته جذاب اینه که این روش نیاز به آموزش سنگین نداره و خیلی راحت به مدل‌های فعلی اضافه می‌شه. 🚀✨

‌های_بینایی_زبانی

منبع: arXiv Computer Vision