🚀 هوشمندتر دیدن؛ راهکار جدید برای غلبه بر «تنبلی بصری» در مدل‌های بینایی-زبانی (VLM)!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

حتماً شنیدید که مدل‌های بینایی-زبانی وقتی با تصاویر با کیفیت بالا روبرو می‌شن، گاهی به جای تحلیل دقیق، به میان‌برهای ذهنی تکیه می‌کنن. محققان در یک پژوهش جدید، روش جالبی به اسم «گرسنگی برای ادراک» (Starve to Perceive) رو معرفی کردن.

💡 در این روش، به جای اجازه دادن به مدل برای مشاهده کل تصویر، پهنای باند بصری اون رو محدود می‌کنن. این کار باعث می‌شه مدل مجبور بشه با «زوم کردن» یا «تغییر کادر»، جزئیات بیشتری رو جستجو کنه. نتیجه؟ یک آموزش فعالانه که دقت مدل‌ها رو به طور قابل‌توجهی بالا می‌بره، بدون اینکه نیاز به تغییرات پیچیده در معماری مدل باشه!

این پیشرفت می‌تونه گام مهمی برای هوشمندتر کردن ایجنت‌های بینایی در محیط‌های واقعی باشه.

منبع: arXiv Computer Vision