🚀 بهینه‌سازی انقلابی برای مدل‌های چندوجهی (OmniLLM) با OmniScope

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا حالا دقت کردید که در مدل‌های چندوجهی (مثل ویدیو و صدا)، چقدر حجم داده‌ها سنگینه؟ محققان به‌تازگی راهکار جذابی به نام «OmniScope» رو معرفی کردن که اجازه میده مدل‌ها بدون نیاز به آموزش مجدد، توکن‌های اضافی رو فشرده کنن.

نکته کلیدی اینجاست: مدل‌های قبلی سعی می‌کردن با یک نگاه کلی، داده‌های صوتی و تصویری رو فشرده کنن، اما OmniScope با تشخیص هوشمندانه اینکه در هر لحظه «صدا» یا «تصویر» اهمیت بیشتری داره، توکن‌های غیرضروری رو حذف می‌کنه.

نتیجه چیه؟
✅ افزایش ۳.۵ برابری سرعت در مرحله پیش‌بینی (Prefill)
✅ کاهش ۱۵ درصدی مصرف حافظه GPU
✅ حفظ دقت عالی در خروجی

این یعنی با منابع سخت‌افزاری کمتر، می‌تونیم مدل‌های چندوجهیِ هوشمندتری داشته باشیم!

اطلاعات بیشتر و کدهای پروژه: https://github.com/MAC-AutoML/OmniScope

منبع: arXiv Computer Vision