محققان در مقاله جدیدی از مدل هوش مصنوعی VLM² رونمایی کردند که یک تحول بزرگ در «استدلال فضایی» رباتها ایجاد میکند. تا پیش از این، اکثر مدلهای بینایی-زبانی در درک سهبعدی محیط و حفظ حافظه در طول زمان ضعف داشتند.
ویژگیهای کلیدی این مدل نوآورانه:
🧠 استفاده از سیستم «حافظه دوگانه»: یک بخش برای پردازش آنی محیط (حافظه کاری) و یک بخش برای ذخیره اطلاعات مهم در طول زمان (حافظه اپیزودیک).
📐 درک سهبعدی دقیق تنها از روی ویدیوهای دوبعدی.
⚡️ بهرهوری بالا در محاسبات و عملکرد خیرهکننده در تستهای جهانی.
این پیشرفت گام بزرگی برای رسیدن به هوش مصنوعیِ دارای «درک بصری و فضایی» است که میتواند در آینده، رباتها را در محیطهای واقعی بسیار هوشمندتر و کارآمدتر کند. نظر شما درباره این سطح از درک فضایی برای رباتها چیست؟
منبع: arXiv Computer Vision
