👁️‍🗨️ هوش مصنوعی بالاخره «جهان» را می‌بیند؛ حل مشکل توهم در مدل‌های چندوجهی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های چندوجهی (MLLMs) در تحلیل تصاویر بسیار قدرتمندند، اما وقتی صحبت از درک جزئیات فضایی (مثل تشخیص اینکه یک شیء دقیقاً کجای تصویر قرار دارد) می‌شود، اغلب دچار توهم (Hallucination) می‌شوند. حالا محققان با معرفی نسخه دوم فریم‌ورک ByDeWay، راهکاری ابداع کرده‌اند که بدون نیاز به آموزش مجدد مدل، از اطلاعات عمق و روابط هندسی اشیاء استفاده می‌کند.

این فناوری که با ترکیب داده‌های سه‌بعدی و مفاهیم فضایی کار می‌کند، باعث می‌شود خروجی‌های هوش مصنوعی در رباتیک و سیستم‌های نظارتی، بسیار قابل‌اعتمادتر و قابل‌تفسیرتر شود. به نوعی، این یعنی افزایش هوش بصری مدل‌ها برای کاربردهای حساس و دقیق! 🤖🛠️

منبع: arXiv Computer Vision