🤖 هوش مصنوعی و انقلابی در مدل‌های بینایی-زبانی-کنشی (VLA)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی، مدل نوآورانه «Action QFormer» را معرفی کرده‌اند که نحوه درک مدل‌های رباتیک از محیط را متحول می‌کند! 🦾

مشکل اصلی مدل‌های فعلی این بود که دستورات مربوط به «عمل کردن» (Action)، گاهی باعث می‌شد مدل دانش بصری و زبانی خود را فراموش کند یا دچار اختلال شود. «Action QFormer» با ایجاد یک رابط پرسش‌محور، اطلاعات چندوجهی را به شکلی هوشمندانه برای انجام کارها سازماندهی می‌کند.

نتایج فوق‌العاده است: در تست‌های شبیه‌سازی، دقت مدل در انجام وظایف از ۱۸٪ به ۵۶٪ و در درک دستورات از ۲۲٪ به ۷۵٪ رسیده است! این یعنی گامی بلند به سوی ربات‌هایی که حرف ما را بهتر می‌فهمند و دقیق‌تر عمل می‌کنند. 🚀

منبع: arXiv Computer Vision