مدلهای چندوجهی (OmniLLMs) که همزمان متن، صوت و ویدیو را درک میکنند، به دلیل پردازش توکنهای سنگین، حافظه زیادی اشغال میکنند. حالا محققان فریمورک جدیدی به نام «OmniDelta» را معرفی کردهاند که بدون نیاز به آموزش مجدد، مدیریتِ هوشمندانه حافظه را به عهده میگیرد.
این ابزار جدید با تشخیصِ اینکه کدام بخش از ویدیو یا صوت اهمیت بیشتری دارد، توکنها را هوشمندانه فشرده میکند. نتیجه؟ کاهش ۲۲ درصدی مصرف حافظه GPU و ۱.۶ برابر سرعت بالاتر در مدلهای قدرتمندی مثل Qwen2.5-Omni! خبر فوقالعادهای برای توسعهدهندگانی که به دنبال اجرای مدلهای سنگین روی سختافزارهای محدودتر هستند. 💡⚡️
های_زبانی سازی
منبع: arXiv AI



