💡 معمای «درهای بسته» در مدل‌های زبانی-تصویری (VLM)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا حالا فکر کردید چرا مدل‌های هوش مصنوعی گاهی با وجود داشتن مسیرهای کمکی، از آن‌ها استفاده نمی‌کنند؟ محققان در پژوهش جدیدی با بررسی مدل‌های Vision-Language متوجه شدند که اکثر سیستم‌های «گیت‌گذاری» (Gating) عملاً غیرفعال هستند و مدل ترجیح می‌دهد سیگنال‌های کمکی را نادیده بگیرد. 🧐

این تحقیق نشان می‌دهد که بهینه‌سازها تمایل دارند این مسیرها را «بسته» نگه دارند چون یا سیگنال‌ها بی‌فایده‌اند یا باعث کاهش دقت می‌شوند. اما نگران نباشید! دانشمندان راهکار جدیدی پیدا کردند: استفاده از «هندسه هذلولی» برای آموزش مدل‌ها که به جای جنگیدن با این مسدودسازی، از آن در جهت بهبود درک روابط بصری بهره می‌برد. پیشرفت‌های این‌چنینی به ما کمک می‌کند تا مدل‌های دقیق‌تر و هوشمندتری در آینده داشته باشیم. 🚀

منبع: arXiv Computer Vision