🚀 معرفی مدل Mage-VL: انقلابی در هوش مصنوعی ویدئویی! 🎥

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های چندوجهی (VLM) معمولاً در تحلیل آفلاین عالی هستند اما در پردازش ویدئوهای زنده (Streaming) ضعیف عمل می‌کنند. حالا مدل جدید «Mage-VL» با یک نوآوری هوشمندانه وارد میدان شده است:

✨ ویژگی‌های کلیدی:
🔹 استفاده از توکنایزر اختصاصی Mage-ViT برای حذف فریم‌های تکراری و کاهش ۷۵ درصدی مصرف توکن‌های بصری.
🔹 معماری الهام‌گرفته از سیستم‌های بیولوژیک (سیستم ۱ سریع برای رویدادها و سیستم ۲ تحلیلی).
🔹 سرعت ۳.۵ برابر بیشتر در استنتاج نسبت به مدل‌های مشابه.
🔹 عملکرد فوق‌العاده در درک فضای سه‌بعدی و تحلیل ویدئو.

این یعنی هوش مصنوعی در آینده نزدیک می‌تواند ویدئوها را به شکل بسیار بهینه‌تر و سریع‌تری «ببیند» و تحلیل کند، بدون اینکه انرژی پردازشی زیادی مصرف شود! 🔥

منبع: arXiv Computer Vision