مدلهای بینایی-زبانی (VLM) معمولاً در تعامل با دنیای فیزیکی و انجام وظایف جدید دچار اشتباه میشوند یا به اصطلاح دچار «توهم» (Hallucination) در استدلالهای خود میشوند.
محققان در مقاله جدیدی، فریمورک نوآورانه «VAORA» را معرفی کردهاند که با استفاده از دو پاداش ویژه (Visual Alignment و Visual-Action Alignment)، مدل را مجبور میکند استدلالهای خود را با واقعیتهای فیزیکی و نتایج عملی اقداماتش همراستا کند. این کار نه تنها توهمات مدل را کاهش میدهد، بلکه باعث میشود هوش مصنوعی در محیطهای کاملاً جدید، عملکرد بسیار منطقیتر و دقیقتری داشته باشد. گامی مهم برای رسیدن به رباتهایی که واقعاً محیط اطرافشان را درک میکنند! 🦾✨
منبع: arXiv AI
