محققان به تازگی معماری جدیدی به نام «MAViE» را معرفی کردهاند که میتواند انقلابی در نحوه درک مدلهای هوش مصنوعی از تصاویر ایجاد کند! 🖼️✨
مشکل اصلی مدلهای فعلی این است که با پردازش تمام جزئیات تصویر، هم سرعت را کاهش میدهند و هم گاهی جزئیات ظریف (مثل متن یا لبهها) را نادیده میگیرند. MAViE با استفاده از یک سیستم مسیریابی هوشمند، فقط روی بخشهای مهم تصویر تمرکز کرده و تعداد توکنهای پردازشی را تا ۸۰ درصد کاهش میدهد! 📉
نتایج اولیه این مدل نشان میدهد که نه تنها سرعت پاسخدهی (Time to First Token) به شدت بهبود یافته، بلکه دقت مدل در آزمونهای دشوار بینایی-زبانی نیز رشد چشمگیری داشته است. این یعنی مدلهای آینده بسیار سریعتر و هوشمندتر خواهند بود. 🤖⚡️
منبع: arXiv Computer Vision
