🧠 معمای «توکن‌های توجه» در مدل‌های بینایی-زبانی: راهکار جدید برای دقت بالاتر

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا تا به حال به این فکر کرده‌اید که مدل‌های هوش مصنوعی چطور همزمان روی جزئیات دقیق یک تصویر تمرکز می‌کنند و درک کلی از صحنه دارند؟ محققان به‌تازگی روی موضوع جذابی به نام «Attention Sinks» در مدل‌های چندوجهی (LVLM) کار کرده‌اند.

این مطالعه نشان می‌دهد که برخی توکن‌ها در شبکه عصبی، توجه بیش از حدی را به خود جلب می‌کنند که گاهی باعث نادیده گرفتن جزئیات مهم می‌شود. خبر خوب اینکه آن‌ها ابزار جدیدی به نام «LSG» طراحی کرده‌اند که مثل یک فیلتر هوشمند عمل می‌کند و باعث می‌شود مدل بین «دید کلی» و «جزئیات دقیق» تعادل برقرار کند. نتیجه؟ عملکرد بهتر مدل‌ها در درک بصری بدون نیاز به آموزش‌های سنگین! 🚀

منبع: arXiv Computer Vision