محققان در تازهترین دستاورد خود، مدل «GeoAnchor» را معرفی کردهاند که مشکل دیرینه درک روابط فضایی سهبعدی از تصاویر دوبعدی را هدف قرار داده است.
مدلهای زبانی چندوجهی فعلی اغلب در درک هندسه پیچیده محیط دچار مشکل هستند؛ اما GeoAnchor با استفاده از یک رویکرد خلاقانه، اطلاعات مکانی را به سه بخش کلیدی «موقعیت»، «جهت» و «هندسه» تجزیه میکند. این ترکیب منحصربهفرد به مدل اجازه میدهد تا نه تنها جزئیات محلی را درک کند، بلکه دید کلی دقیقتری نسبت به محیط داشته باشد.
این پیشرفت میتواند نقطه عطفی برای رباتیک و سیستمهای بینایی ماشین باشد تا محیط پیرامون را هوشمندانهتر و واقعیتر تفسیر کنند. 🤖✨
منبع: arXiv AI
