محققان در مقاله جدیدی به نام Blind-Spots-Bench به نکته جالبی اشاره کردهاند: مدلهای هوش مصنوعی که در آزمونهای پیچیده نمرات درخشانی میگیرند، گاهی در انجام کارهای بسیار ساده انسانی (مثل کشیدن یک سگ با ۵ پا!) کاملاً گیج میشوند.
این بنچمارک جدید با مجموعهای از سوالات طراحی شده توسط دانشجویان، تلاش میکند این «نقاط کور» مدلهای زبانی و تصویری را شناسایی کند. نتیجه تحقیقات نشان میدهد که حتی قدرتمندترین مدلهای جهان نیز در مواجهه با برخی وظایف پایه، همچنان ضعفهای جدی دارند. این دستاورد، گام مهمی برای درک محدودیتهای واقعی AI و تلاش برای رفع آنهاست.
منبع: arXiv AI
