محققان در یک پژوهش جذاب، بنچمارک جدیدی به نام «BabyVision» را معرفی کردهاند که توانایی درک بصری مدلهای هوش مصنوعی (MLLMs) را به چالش میکشد. نتیجه جالب اینجاست که حتی پیشرفتهترین مدلها مثل Gemini3-Pro، در انجام وظایف سادهی بصری که یک کودک ۳ تا ۶ ساله به راحتی از پس آنها برمیآید، عملکرد ضعیفی دارند! 📉
این تحقیق نشان میدهد که مدلهای فعلی بهشدت به دادههای متنی تکیه میکنند و هنوز در درک مفاهیم پایهای دنیای فیزیکی (بدون نیاز به زبان) ضعف دارند. BabyVision آمده تا مسیر هوش مصنوعی را برای رسیدن به «ادراک انسانی» هموارتر کند. 🧠✨
منبع: arXiv Computer Vision
