محققان در پژوهش جدیدی بنچمارک جذابی به نام EgoDyn-Bench معرفی کردند تا توانایی مدلهای هوش مصنوعی در درک «حرکت خودرو» (Ego-Motion) را به چالش بکشند. 🧐
نتیجه جالب و کمی نگرانکننده است: اکثر مدلهای بینایی-زبانی (VLMs) علیرغم هوش بالایی که دارند، در تطبیق منطق فیزیکی با آنچه در تصویر میبینند ضعف دارند و گاهی از روشهای ساده هندسی قدیمی هم عقب میمانند! این یعنی یک «گلوگاه ادراکی» در ساختار فعلی مدلهای خودران وجود دارد که درک فیزیکی آنها را از محیط مختل میکند. 🚧
این تحقیق نشان میدهد که برای رسیدن به خودرانهای ایمنتر، صرفاً بزرگ کردن مدلها کافی نیست و باید راهی برای پیوند دقیقترِ «تصویر» و «قوانین فیزیکی حرکت» پیدا کنیم.
منبع: arXiv Computer Vision
