مدلهای زبانی چندوجهی (MLLM) علیرغم پیشرفتهای خیرهکننده، هنوز در درک روابط سهبعدی دچار مشکل هستند و گاهی تصاویری را توصیف میکنند که با واقعیت هندسی صحنه تضاد دارد.
محققان در مطالعه جدید خود، فریمورک نوآورانه «Geo3R» را معرفی کردهاند که بدون نیاز به آموزش اضافی (Training-free)، به صورت «پلاگانپلِی» به این مدلها کمک میکند تا با درک هندسی دقیقتر، خطاهای فضایی و توهمات (Hallucinations) را به حداقل برسانند. این متد جدید بهویژه در تحلیل جهتگیری اشیاء و تغییرات زاویه دید عملکرد فوقالعادهای دارد. 🛠️✨
منبع: arXiv Computer Vision
