🚀 بهینه‌سازی خیره‌کننده در مدل‌های بینایی-زبانی: معرفی روش جدید کاهش توکن

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های بزرگ بینایی-زبانی (VLM) اگرچه بسیار قدرتمند هستند، اما به دلیل حجم بالای توکن‌های بصری، اجرای آن‌ها روی دستگاه‌های موبایل یا لبه (Edge Devices) بسیار دشوار است.

محققان به تازگی یک فریم‌ورک «بدون توجه» (Attention-Free) و سبک معرفی کرده‌اند که به عنوان یک ماژول جانبی به مدل‌ها اضافه می‌شود. این روش با استفاده از یک رویکرد مبتنی بر نظریه اطلاعات، توکن‌های غیرضروری را حذف می‌کند و بدون نیاز به محاسبات سنگینِ شباهت، مدل را بسیار سریع‌تر و کارآمدتر می‌کند. این یعنی در آینده نزدیک، مدل‌های هوش مصنوعیِ بینایی بسیار سریع‌تر روی گوشی‌های ما اجرا خواهند شد! 📱✨

منبع: arXiv Computer Vision