مدلهای بزرگ بینایی-زبانی (VLM) اگرچه بسیار قدرتمند هستند، اما به دلیل حجم بالای توکنهای بصری، اجرای آنها روی دستگاههای موبایل یا لبه (Edge Devices) بسیار دشوار است.
محققان به تازگی یک فریمورک «بدون توجه» (Attention-Free) و سبک معرفی کردهاند که به عنوان یک ماژول جانبی به مدلها اضافه میشود. این روش با استفاده از یک رویکرد مبتنی بر نظریه اطلاعات، توکنهای غیرضروری را حذف میکند و بدون نیاز به محاسبات سنگینِ شباهت، مدل را بسیار سریعتر و کارآمدتر میکند. این یعنی در آینده نزدیک، مدلهای هوش مصنوعیِ بینایی بسیار سریعتر روی گوشیهای ما اجرا خواهند شد! 📱✨
منبع: arXiv Computer Vision
