🚀 افزایش چشمگیر سرعت مدل‌های بینایی-زبانی با روش نوین SpecFlow!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از چالش‌های اصلی مدل‌های VLM، هزینه بالای پردازش توکن‌های بصری طولانی است. حالا محققان روشی به نام «SpecFlow» معرفی کرده‌اند که بدون نیاز به آموزش مجدد (Training-free)، به شکلی هوشمندانه توکن‌های بصری را فشرده می‌کند.

ویژگی‌های کلیدی این روش:
✅ حفظ ۹۵.۶٪ از عملکرد مدل تنها با حذف ۸۹٪ از توکن‌ها!
✅ سازگاری کامل با FlashAttention و معماری‌های مختلف.
✅ حفظ ساختار بصری و یکپارچگی آماری برخلاف روش‌های سنتی حذف توکن.

این یعنی به زودی شاهد مدل‌های بینایی-زبانی سریع‌تر و بهینه‌تر خواهیم بود که اجرای آن‌ها روی سیستم‌های معمولی بسیار آسان‌تر می‌شود. اگر در حوزه بینایی ماشین یا توسعه مدل‌های بزرگ فعالیت می‌کنید، بررسی این متد بسیار ارزشمند است.

🔗 لینک پروژه: https://github.com/Lzy-dot/SpecFlow

منبع: arXiv Computer Vision