مدلهای زبانی چندوجهی (MLLM) معمولاً در درک روابط فضایی دچار اشتباه میشوند، چون بیش از حد به زاویه دوربین وابسته هستند. محققان به تازگی فریمورک جدیدی به نام OrientSAM معرفی کردهاند که این «کوتاهبینی» مدلها را درمان میکند!
با این روش جدید، هوش مصنوعی یاد میگیرد اشیاء را نه فقط از دید دوربین، بلکه از دیدگاههای مختلف و بر اساس جهتگیری آنها درک کند. این یعنی رباتها و سیستمهای بینایی در آینده درک بسیار دقیقتر و انسانیتری از محیط اطراف خود خواهند داشت. 🧠✨
منبع: arXiv AI
