محققان در مطالعه جدید خود به بررسی این موضوع پرداختهاند که چرا مدلهای هوش مصنوعی «بینایی کامپیوتر» (Vision Transformers) در درک اشیاء، رفتاری مشابه انسان پیدا کردهاند.
نتایج این تحقیق نشان میدهد که مدلهای مبتنی بر معماری DINO بهترین عملکرد را در تشخیص و تفکیک اشیاء دارند و هرچه ساختار درونی این مدلها به «مرکزیت اشیاء» (Object-centric) نزدیکتر باشد، دقت آنها در شبیهسازی رفتار بصری انسان بالاتر میرود. این دستاورد گام مهمی در جهت ساخت سیستمهای بینایی است که جهان را دقیقاً مثل ما میبینند!
منبع: arXiv AI
