آیا تا به حال به این فکر کردهاید که مدلهای هوش مصنوعی چطور همزمان روی جزئیات دقیق یک تصویر تمرکز میکنند و درک کلی از صحنه دارند؟ محققان بهتازگی روی موضوع جذابی به نام «Attention Sinks» در مدلهای چندوجهی (LVLM) کار کردهاند.
این مطالعه نشان میدهد که برخی توکنها در شبکه عصبی، توجه بیش از حدی را به خود جلب میکنند که گاهی باعث نادیده گرفتن جزئیات مهم میشود. خبر خوب اینکه آنها ابزار جدیدی به نام «LSG» طراحی کردهاند که مثل یک فیلتر هوشمند عمل میکند و باعث میشود مدل بین «دید کلی» و «جزئیات دقیق» تعادل برقرار کند. نتیجه؟ عملکرد بهتر مدلها در درک بصری بدون نیاز به آموزشهای سنگین! 🚀
منبع: arXiv Computer Vision
