مدلهای پیشرفته بینایی-زبانی (VLM) مثل Qwen-VL یا InternVL برای پردازش تصاویر با رزولوشن بالا، حجم بسیار زیادی «توکن بصری» تولید میکنند که پردازش آنها بسیار هزینهبر و کند است.
محققان در مقاله جدیدی روشی نوآورانه به نام GOTS (Greedy Orthogonal Token Selection) را معرفی کردهاند که به جای روشهای سنتی، با استفاده از هندسه برداری، توکنهای «اضافی» و غیرضروری را حذف میکند.
✨ چرا این خبر مهم است؟
این متد بدون نیاز به آموزش مجدد و بسیار هوشمندانه عمل میکند. نتیجه؟ سرعت بالاتر در پاسخدهی (Time-to-first-token) و حفظ دقت مدل بدون مصرف منابع اضافی. این یعنی گامی بزرگ برای اجرای مدلهای قدرتمند روی سیستمهای سبکتر!
🔗 دسترسی به کد پروژه در گیتهاب
منبع: arXiv AI
