🤖 هوش مصنوعی و حل چالش «استدلال فیزیکی»؛ معرفی متد VAORA

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های بینایی-زبانی (VLM) معمولاً در تعامل با دنیای فیزیکی و انجام وظایف جدید دچار اشتباه می‌شوند یا به اصطلاح دچار «توهم» (Hallucination) در استدلال‌های خود می‌شوند.

محققان در مقاله جدیدی، فریم‌ورک نوآورانه «VAORA» را معرفی کرده‌اند که با استفاده از دو پاداش ویژه (Visual Alignment و Visual-Action Alignment)، مدل را مجبور می‌کند استدلال‌های خود را با واقعیت‌های فیزیکی و نتایج عملی اقداماتش هم‌راستا کند. این کار نه تنها توهمات مدل را کاهش می‌دهد، بلکه باعث می‌شود هوش مصنوعی در محیط‌های کاملاً جدید، عملکرد بسیار منطقی‌تر و دقیق‌تری داشته باشد. گامی مهم برای رسیدن به ربات‌هایی که واقعاً محیط اطرافشان را درک می‌کنند! 🦾✨

منبع: arXiv AI