مدلهای چندوجهی (MLLMs) در تحلیل تصاویر بسیار قدرتمندند، اما وقتی صحبت از درک جزئیات فضایی (مثل تشخیص اینکه یک شیء دقیقاً کجای تصویر قرار دارد) میشود، اغلب دچار توهم (Hallucination) میشوند. حالا محققان با معرفی نسخه دوم فریمورک ByDeWay، راهکاری ابداع کردهاند که بدون نیاز به آموزش مجدد مدل، از اطلاعات عمق و روابط هندسی اشیاء استفاده میکند.
این فناوری که با ترکیب دادههای سهبعدی و مفاهیم فضایی کار میکند، باعث میشود خروجیهای هوش مصنوعی در رباتیک و سیستمهای نظارتی، بسیار قابلاعتمادتر و قابلتفسیرتر شود. به نوعی، این یعنی افزایش هوش بصری مدلها برای کاربردهای حساس و دقیق! 🤖🛠️
منبع: arXiv Computer Vision
