🧠 تقویت درک فضایی مدل‌های هوش مصنوعی با متد جدید GAP-MLLM

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی چندوجهی (MLLM) علی‌رغم توانمندی‌های خیره‌کننده، در درک فضای سه‌بعدی ضعف دارند. پژوهشگران با معرفی روش جدید «GAP-MLLM»، پارادایم پیش‌آموزش جدیدی را ابداع کرده‌اند که به مدل‌ها کمک می‌کند پیش از مواجهه با وظایف پیچیده، «آگاهی هندسی» پیدا کنند.

در این روش، مدل با پیش‌بینی نقشه‌های نقطه‌ای (Pointmaps) در کنار برچسب‌های متنی، ساختار سه‌بعدی محیط را بسیار دقیق‌تر درک می‌کند. این دستاورد می‌تواند تحولی در درک بصری ربات‌ها و سیستم‌های ناوبری هوشمند ایجاد کند. 🤖✨

منبع: arXiv Computer Vision