آیا مدلهای قدرتمند هوش مصنوعی مثل GPT-5.5 یا Claude واقعاً «میبینند»؟ یک مطالعه جدید با معرفی بنچمارک ActiveVision نشان میدهد که این مدلها در کارهایی که نیاز به مشاهده فعال و رفتوبرگشت بصری دارند (مثل انسان)، به شدت ضعیف عمل میکنند.
در حالی که انسانها در این آزمونها دقت ۹۶ درصدی دارند، قویترین مدلهای حال حاضر در اکثر موارد حتی نمیتوانند ۱۰ درصد از سوالات را حل کنند! این تحقیق ثابت میکند که مدلهای فعلی هنوز در درک پویای محیط دچار چالشهای اساسی هستند و نیاز به معماریهای جدیدی دارند که «حلقه ادراک و استدلال» را کامل کند. 🔍🤖
منبع: arXiv AI
