محققان در مقاله جدیدی، مدل نوآورانه «Action QFormer» را معرفی کردهاند که نحوه درک مدلهای رباتیک از محیط را متحول میکند! 🦾
مشکل اصلی مدلهای فعلی این بود که دستورات مربوط به «عمل کردن» (Action)، گاهی باعث میشد مدل دانش بصری و زبانی خود را فراموش کند یا دچار اختلال شود. «Action QFormer» با ایجاد یک رابط پرسشمحور، اطلاعات چندوجهی را به شکلی هوشمندانه برای انجام کارها سازماندهی میکند.
نتایج فوقالعاده است: در تستهای شبیهسازی، دقت مدل در انجام وظایف از ۱۸٪ به ۵۶٪ و در درک دستورات از ۲۲٪ به ۷۵٪ رسیده است! این یعنی گامی بلند به سوی رباتهایی که حرف ما را بهتر میفهمند و دقیقتر عمل میکنند. 🚀
منبع: arXiv Computer Vision
