👶 هوش مصنوعی هنوز در درک بصری مثل یک کودک است!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جذاب، بنچمارک جدیدی به نام «BabyVision» را معرفی کرده‌اند که توانایی درک بصری مدل‌های هوش مصنوعی (MLLMs) را به چالش می‌کشد. نتیجه جالب اینجاست که حتی پیشرفته‌ترین مدل‌ها مثل Gemini3-Pro، در انجام وظایف ساده‌ی بصری که یک کودک ۳ تا ۶ ساله به راحتی از پس آن‌ها برمی‌آید، عملکرد ضعیفی دارند! 📉

این تحقیق نشان می‌دهد که مدل‌های فعلی به‌شدت به داده‌های متنی تکیه می‌کنند و هنوز در درک مفاهیم پایه‌ای دنیای فیزیکی (بدون نیاز به زبان) ضعف دارند. BabyVision آمده تا مسیر هوش مصنوعی را برای رسیدن به «ادراک انسانی» هموارتر کند. 🧠✨

منبع: arXiv Computer Vision