دانشمندان در تحقیق جدیدی به سراغ یکی از چالشهای بزرگ مدلهای بینایی-زبانی (VLM) رفتهاند: اینکه آیا واقعاً برای هر سوال، به تمام لایههای پردازشی مدل نیاز داریم؟
این مقاله نشان میدهد که با استفاده از یک جستجوی تکاملی، میتوانیم بخشهای غیرضروری از شبکه عصبی را برای وظایف خاص (مثل خواندن متن یا تشخیص اشیاء) حذف کنیم. نتایج نشان میدهد که انتخاب هوشمندانه مسیرهای پردازشی (Route) در مدلهایی مثل Qwen2.5-VL، میتواند دقت و سرعت را به شکل قابل توجهی بهبود ببخشد و محاسبات اضافی را به حداقل برساند. این یعنی مدلهای آینده با توان کمتر، هوشمندتر عمل خواهند کرد! 🧠✨
منبع: arXiv Computer Vision
