مدلهای زبانی بزرگ چندوجهی (OmniLLMs) که همزمان صدا و ویدیو را تحلیل میکنند، معمولاً به دلیل پردازش توالیهای طولانی، کند هستند و حافظه زیادی مصرف میکنند.
محققان در پژوهش جدیدی، تکنیک «Omni-Prune» را معرفی کردهاند که بدون نیاز به آموزش مجدد، اطلاعات زائد را از صدا و ویدیو حذف میکند.
✅ ویژگیهای برجسته این روش:
• افزایش سرعت پردازش تا ۳.۲۵ برابر
• کاهش مصرف حافظه تا ۳۰ درصد
• حفظ بیش از ۹۹ درصد دقت مدل اصلی
این نوآوری با در نظر گرفتن «پرسش کاربر» و پیوندهای صوتی-تصویری، دقیقاً بخشهای مهم محتوا را نگه میدارد که گامی بزرگ برای بهینهسازی هوش مصنوعیهای پیشرفته است.
سازی
منبع: arXiv Computer Vision
