محققان در یک پژوهش تازه، معمای جالبی رو در مدلهای بزرگ بینایی-زبانی (LVLM) حل کردند! آنها متوجه شدند که «Attention Sink»ها یا همان توکنهایی که توجه زیادی رو به خودشون جذب میکنند، هم میتونن کمککننده باشن (برای درک کلی صحنه) و هم دردسرساز (با نادیده گرفتن جزئیات دقیق).
در این مطالعه، یک تکنیک جدید به نام «LSG» معرفی شده که مثل یک دروازهبان هوشمند عمل میکنه و به مدل اجازه میده تا تعادل بهتری بین دید کلی و دقت جزئیات برقرار کنه. نکته جذاب اینه که این روش نیاز به آموزش سنگین نداره و خیلی راحت به مدلهای فعلی اضافه میشه. 🚀✨
های_بینایی_زبانی
منبع: arXiv Computer Vision
