👁️ شکست مدل‌های بینایی-زبانی در آزمون «مشاهده فعال»!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های قدرتمند هوش مصنوعی مثل GPT-5.5 یا Claude واقعاً «می‌بینند»؟ یک مطالعه جدید با معرفی بنچمارک ActiveVision نشان می‌دهد که این مدل‌ها در کارهایی که نیاز به مشاهده فعال و رفت‌وبرگشت بصری دارند (مثل انسان)، به شدت ضعیف عمل می‌کنند.

در حالی که انسان‌ها در این آزمون‌ها دقت ۹۶ درصدی دارند، قوی‌ترین مدل‌های حال حاضر در اکثر موارد حتی نمی‌توانند ۱۰ درصد از سوالات را حل کنند! این تحقیق ثابت می‌کند که مدل‌های فعلی هنوز در درک پویای محیط دچار چالش‌های اساسی هستند و نیاز به معماری‌های جدیدی دارند که «حلقه ادراک و استدلال» را کامل کند. 🔍🤖

منبع: arXiv AI