🚀 جهش بزرگ در هوش مصنوعی: ربات‌ها با VLM² دنیا را بهتر می‌بینند!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی از مدل هوش مصنوعی VLM² رونمایی کردند که یک تحول بزرگ در «استدلال فضایی» ربات‌ها ایجاد می‌کند. تا پیش از این، اکثر مدل‌های بینایی-زبانی در درک سه‌بعدی محیط و حفظ حافظه در طول زمان ضعف داشتند.

ویژگی‌های کلیدی این مدل نوآورانه:
🧠 استفاده از سیستم «حافظه دوگانه»: یک بخش برای پردازش آنی محیط (حافظه کاری) و یک بخش برای ذخیره اطلاعات مهم در طول زمان (حافظه اپیزودیک).
📐 درک سه‌بعدی دقیق تنها از روی ویدیوهای دوبعدی.
⚡️ بهره‌وری بالا در محاسبات و عملکرد خیره‌کننده در تست‌های جهانی.

این پیشرفت گام بزرگی برای رسیدن به هوش مصنوعیِ دارای «درک بصری و فضایی» است که می‌تواند در آینده، ربات‌ها را در محیط‌های واقعی بسیار هوشمندتر و کارآمدتر کند. نظر شما درباره این سطح از درک فضایی برای ربات‌ها چیست؟

منبع: arXiv Computer Vision