محققان در مقاله جدیدی از مدل نوآورانه «SceneBind» رونمایی کردند که هدفش تغییر نحوه درک هوش مصنوعی از محیط است. برخلاف مدلهای قبلی که فقط میدانستند «چه چیزی» در تصویر وجود دارد، SceneBind درک عمیقی از «کجا بودن» (مکانمند بودن) اشیاء در فضای سهبعدی را نیز به مدلها اضافه میکند.
این مدل با ترکیب هوشمندانه دادههای بینایی، صوت و زبان، میتواند صحنهها را به صورت موجودیتهای فضایی-معنایی تحلیل کند. این یعنی رباتها و سیستمهای بینایی ماشین در آینده، تعامل بسیار دقیقتر و واقعیتری با محیط پیرامون خود خواهند داشت. 🌐📍
نکته جالب این است که SceneBind بسیار سبک بوده و به راحتی با مدلهای بزرگ فعلی ادغام میشود تا دقت بازیابی صحنهها را به سطح جدیدی برساند.
منبع: arXiv Computer Vision
