🚀 افزایش سرعت و بهره‌وری مدل‌های چندوجهی با Omni-Prune

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی بزرگ چندوجهی (OmniLLMs) که همزمان صدا و ویدیو را تحلیل می‌کنند، معمولاً به دلیل پردازش توالی‌های طولانی، کند هستند و حافظه زیادی مصرف می‌کنند.

محققان در پژوهش جدیدی، تکنیک «Omni-Prune» را معرفی کرده‌اند که بدون نیاز به آموزش مجدد، اطلاعات زائد را از صدا و ویدیو حذف می‌کند.

✅ ویژگی‌های برجسته این روش:
• افزایش سرعت پردازش تا ۳.۲۵ برابر
• کاهش مصرف حافظه تا ۳۰ درصد
• حفظ بیش از ۹۹ درصد دقت مدل اصلی

این نوآوری با در نظر گرفتن «پرسش کاربر» و پیوندهای صوتی-تصویری، دقیقاً بخش‌های مهم محتوا را نگه می‌دارد که گامی بزرگ برای بهینه‌سازی هوش مصنوعی‌های پیشرفته است.

‌سازی

منبع: arXiv Computer Vision