یکی از چالشهای اصلی مدلهای VLM، هزینه بالای پردازش توکنهای بصری طولانی است. حالا محققان روشی به نام «SpecFlow» معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-free)، به شکلی هوشمندانه توکنهای بصری را فشرده میکند.
ویژگیهای کلیدی این روش:
✅ حفظ ۹۵.۶٪ از عملکرد مدل تنها با حذف ۸۹٪ از توکنها!
✅ سازگاری کامل با FlashAttention و معماریهای مختلف.
✅ حفظ ساختار بصری و یکپارچگی آماری برخلاف روشهای سنتی حذف توکن.
این یعنی به زودی شاهد مدلهای بینایی-زبانی سریعتر و بهینهتر خواهیم بود که اجرای آنها روی سیستمهای معمولی بسیار آسانتر میشود. اگر در حوزه بینایی ماشین یا توسعه مدلهای بزرگ فعالیت میکنید، بررسی این متد بسیار ارزشمند است.
🔗 لینک پروژه: https://github.com/Lzy-dot/SpecFlow
منبع: arXiv Computer Vision
