اگر با مدلهای OmniLLM کار کرده باشید، میدانید که پردازش همزمان صدا و تصویر چقدر میتواند سنگین و پرهزینه باشد. محققان به تازگی روشی به نام «OmniFocus» معرفی کردهاند که به جای پردازش تمام دادهها، با اولویتبندی هوشمند و مستقل برای هر مودالیته، توکنهای اضافی را حذف میکند.
نتایج روی مدل Qwen2.5-Omni خیرهکننده است: حفظ دقت ۵۹ درصدی در کنار افزایش ۱.۳۸ برابری سرعت در مرحله پیشتولید (Prefill). این یعنی آیندهای با مدلهای چندوجهیِ سریعتر و ارزانتر! 💡🤖
منبع: arXiv AI
