🚀 جهشی بزرگ در کارایی مدل‌های بینایی-زبانی: معرفی MAViE

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی معماری جدیدی به نام «MAViE» را معرفی کرده‌اند که می‌تواند انقلابی در نحوه درک مدل‌های هوش مصنوعی از تصاویر ایجاد کند! 🖼️✨

مشکل اصلی مدل‌های فعلی این است که با پردازش تمام جزئیات تصویر، هم سرعت را کاهش می‌دهند و هم گاهی جزئیات ظریف (مثل متن یا لبه‌ها) را نادیده می‌گیرند. MAViE با استفاده از یک سیستم مسیریابی هوشمند، فقط روی بخش‌های مهم تصویر تمرکز کرده و تعداد توکن‌های پردازشی را تا ۸۰ درصد کاهش می‌دهد! 📉

نتایج اولیه این مدل نشان می‌دهد که نه تنها سرعت پاسخ‌دهی (Time to First Token) به شدت بهبود یافته، بلکه دقت مدل در آزمون‌های دشوار بینایی-زبانی نیز رشد چشمگیری داشته است. این یعنی مدل‌های آینده بسیار سریع‌تر و هوشمندتر خواهند بود. 🤖⚡️

منبع: arXiv Computer Vision