محققان به تازگی بنچمارک جدیدی به نام EgoSafe-Bench را معرفی کردهاند که برای تست توانایی «استدلال ایمنی» در هوش مصنوعی طراحی شده است.
مشکل کجاست؟ مدلهای بینایی-زبانی (LVLM) فعلی مثل Gemini یا Qwen3-VL در توصیف تصاویر عالی هستند، اما وقتی پای «درک علت و معلول» در دنیای واقعی و فیلمهای اولشخص (Egocentric) به میان میآید، دچار سردرگمی میشوند!
این بنچمارک با ۱۲ هزار نمونه سوال، مدلها را مجبور میکند به جای میانبر زدن، واقعاً شرایط خطرناک را تحلیل کنند. نتیجه این تحقیق نشان میدهد که هوش مصنوعی هنوز در تشخیص منطقِ پنهانِ پشت حوادث، ضعفهای جدی دارد. قدمی مهم برای رسیدن به سیستمهای بینایی ایمنتر! 🤖👁️
منبع: arXiv Computer Vision
