محققان در یک پژوهش جدید، عملکرد «مدلهای بینایی هوش مصنوعی» (Vision Models) را با درک انسانی از محیط مقایسه کردند. نتیجه جالب اینکه: مدلهای مجهز به معماری ترنسفورمر که با روش DINO آموزش دیدهاند، شباهت فوقالعادهای به ادراکِ اشیاء توسط انسان دارند.
این مطالعه نشان میدهد که برای ساخت هوش مصنوعیِ «انسانگونهتر»، صرفاً افزایش داده کافی نیست؛ بلکه ساختار داخلی مدل (Object-centric structure) نقش تعیینکنندهای در درک دقیقتر محیط دارد. گام بزرگی برای نزدیکتر شدن به بیناییِ واقعی! 🤖✨
منبع: arXiv AI
