🚀 بهینه‌سازی خیره‌کننده در مدل‌های بینایی-زبانی (VLM) با روش GOTS

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های پیشرفته بینایی-زبانی (VLM) مثل Qwen-VL یا InternVL برای پردازش تصاویر با رزولوشن بالا، حجم بسیار زیادی «توکن بصری» تولید می‌کنند که پردازش آن‌ها بسیار هزینه‌بر و کند است.

محققان در مقاله جدیدی روشی نوآورانه به نام GOTS (Greedy Orthogonal Token Selection) را معرفی کرده‌اند که به جای روش‌های سنتی، با استفاده از هندسه برداری، توکن‌های «اضافی» و غیرضروری را حذف می‌کند.

چرا این خبر مهم است؟
این متد بدون نیاز به آموزش مجدد و بسیار هوشمندانه عمل می‌کند. نتیجه؟ سرعت بالاتر در پاسخ‌دهی (Time-to-first-token) و حفظ دقت مدل بدون مصرف منابع اضافی. این یعنی گامی بزرگ برای اجرای مدل‌های قدرتمند روی سیستم‌های سبک‌تر!

🔗 دسترسی به کد پروژه در گیت‌هاب

منبع: arXiv AI