🔍 راز «تعمیم‌پذیری» در مدل‌های بینایی؛ چرا هوش مصنوعی باید مثل انسان ببیند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید به بررسی این سوال پرداخته‌اند که هوش مصنوعی برای درک مفاهیم در شرایط جدید (که قبلاً ندیده) به چه ساختار هندسی در لایه‌های درونی خود نیاز دارد.

نتایج این تحقیق نشان می‌دهد که برای اینکه مدل‌های بینایی (مانند CLIP یا DINO) بتوانند مفاهیم را به‌صورت ترکیبی درک کنند، باید بازنمایی‌های آن‌ها در فضای برداری به صورت «خطی» و «متعامد» (Orthogonal) تجزیه شود. این یعنی مفاهیم باید به اجزای مستقل تقسیم شوند تا مدل بتواند آن‌ها را در زمینه‌های جدید با دقت بالا بازسازی کند.

این کشف، تئوری Linear Representation Hypothesis را تقویت کرده و نقشه راهی برای توسعه مدل‌های قدرتمندتر و هوشمندتر در آینده است. 🧠✨

منبع: arXiv Computer Vision