🚀 هوش مصنوعی چگونه «می‌بیند» و «استدلال» می‌کند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به بررسی چرایی ضعف برخی مدل‌های بینایی-زبانی (VLM) در استدلال‌های مبتنی بر شواهد پرداخته‌اند. آن‌ها متوجه شدند که این مدل‌ها در لایه‌های میانی خود دارای یک «پنجره رله بصری» (VRW) هستند که نقش حیاتی در اتصال بینایی به متن ایفا می‌کند.

با معرفی چارچوب جدیدی به نام TRACE، محققان موفق شدند با کنترل دقیق‌تر روی این چرخه داخلی، دقت مدل‌ها را در تحلیل‌های دقیق بینایی تا ۶.۶ درصد افزایش دهند. این گام بزرگی برای هوش مصنوعی است تا هنگام «دیدن» اشیاء، کمتر دچار اشتباه شود! 🧠✨

منبع: arXiv AI