مدلهای چندوجهی (VLM) معمولاً در تحلیل آفلاین عالی هستند اما در پردازش ویدئوهای زنده (Streaming) ضعیف عمل میکنند. حالا مدل جدید «Mage-VL» با یک نوآوری هوشمندانه وارد میدان شده است:
✨ ویژگیهای کلیدی:
🔹 استفاده از توکنایزر اختصاصی Mage-ViT برای حذف فریمهای تکراری و کاهش ۷۵ درصدی مصرف توکنهای بصری.
🔹 معماری الهامگرفته از سیستمهای بیولوژیک (سیستم ۱ سریع برای رویدادها و سیستم ۲ تحلیلی).
🔹 سرعت ۳.۵ برابر بیشتر در استنتاج نسبت به مدلهای مشابه.
🔹 عملکرد فوقالعاده در درک فضای سهبعدی و تحلیل ویدئو.
این یعنی هوش مصنوعی در آینده نزدیک میتواند ویدئوها را به شکل بسیار بهینهتر و سریعتری «ببیند» و تحلیل کند، بدون اینکه انرژی پردازشی زیادی مصرف شود! 🔥
منبع: arXiv Computer Vision
