محققان به تازگی بنچمارک جدیدی به نام «MultiView-Bench» معرفی کردهاند که توانایی مدلهای بینایی-زبانی (VLMs) را در درک محیطهای سهبعدی و ترکیب دیدگاههای مختلف به چالش میکشد. 🌍
نتیجه جالب این تحقیق این است که مدلهای فعلی، با وجود قدرت در تحلیل تصاویر دوبعدی، در درک روابط فضایی سهبعدی و ادغام اطلاعات از زوایای مختلف ضعف دارند! این یعنی هوش مصنوعی هنوز تا درک کامل «جهانمحور» راه زیادی دارد.
همچنین در این پژوهش، چارچوب جدیدی به نام «ViewNavigator» معرفی شده که با انتخاب هوشمندانه زوایای دید، به مدلها کمک میکند تا درک بسیار دقیقتری از محیط پیدا کنند و حتی در وظایف پیچیدهای مثل اسمبل کردن قطعات مکانیکی بهتر عمل کنند. گام بزرگی به سوی رباتهای هوشمندتر! 🤖🛠
منبع: arXiv AI
