محققان در مطالعهای جدید به بررسی این سوال پرداختهاند که هوش مصنوعی برای درک مفاهیم در شرایط جدید (که قبلاً ندیده) به چه ساختار هندسی در لایههای درونی خود نیاز دارد.
نتایج این تحقیق نشان میدهد که برای اینکه مدلهای بینایی (مانند CLIP یا DINO) بتوانند مفاهیم را بهصورت ترکیبی درک کنند، باید بازنماییهای آنها در فضای برداری به صورت «خطی» و «متعامد» (Orthogonal) تجزیه شود. این یعنی مفاهیم باید به اجزای مستقل تقسیم شوند تا مدل بتواند آنها را در زمینههای جدید با دقت بالا بازسازی کند.
این کشف، تئوری Linear Representation Hypothesis را تقویت کرده و نقشه راهی برای توسعه مدلهای قدرتمندتر و هوشمندتر در آینده است. 🧠✨
,
منبع: arXiv Computer Vision
