محققان به تازگی مدل جدیدی به نام «S-Agent» معرفی کردهاند که دنیای هوش مصنوعی را در درک محیطهای سهبعدی و فضایی متحول میکند. برخلاف مدلهای فعلی که اغلب تصاویر را به صورت تکفریم و ایزوله تحلیل میکنند، S-Agent میتواند با استفاده از حافظه زمانی و ابزارهای هندسی، اطلاعات را در طول زمان و در ویدیوها جمعآوری کرده و درک عمیقتر و دقیقتری از محیط (مانند اندازهگیری، شمارش اشیاء و درک موقعیت) به دست آورد.
نکته هیجانانگیز اینجاست که این مدل بدون نیاز به آموزش مجدد و سنگین، عملکرد مدلهای بینایی-زبانی (VLM) را به طرز چشمگیری در کارهای پیچیده فضایی بهبود میبخشد. این یعنی رباتها و دستیارهای هوشمند در آینده بسیار بهتر از قبل محیط اطرافشان را درک خواهند کرد! 🤖✨
منبع: arXiv Computer Vision
