تا حالا دقت کردید که در مدلهای چندوجهی (مثل ویدیو و صدا)، چقدر حجم دادهها سنگینه؟ محققان بهتازگی راهکار جذابی به نام «OmniScope» رو معرفی کردن که اجازه میده مدلها بدون نیاز به آموزش مجدد، توکنهای اضافی رو فشرده کنن.
نکته کلیدی اینجاست: مدلهای قبلی سعی میکردن با یک نگاه کلی، دادههای صوتی و تصویری رو فشرده کنن، اما OmniScope با تشخیص هوشمندانه اینکه در هر لحظه «صدا» یا «تصویر» اهمیت بیشتری داره، توکنهای غیرضروری رو حذف میکنه.
نتیجه چیه؟
✅ افزایش ۳.۵ برابری سرعت در مرحله پیشبینی (Prefill)
✅ کاهش ۱۵ درصدی مصرف حافظه GPU
✅ حفظ دقت عالی در خروجی
این یعنی با منابع سختافزاری کمتر، میتونیم مدلهای چندوجهیِ هوشمندتری داشته باشیم!
اطلاعات بیشتر و کدهای پروژه: https://github.com/MAC-AutoML/OmniScope
منبع: arXiv Computer Vision
