محققان در مقالهی جدیدی، مدل نوآورانهای به نام CLAP را معرفی کردند که پل ارتباطی بین مدلهای بصری-زبانی (VLM) و مدلهای رباتیک (VLA) است.
مشکل اصلی مدلهای فعلی این است که وقتی آنها را برای کنترل ربات آموزش میدهیم، تواناییهای زبانیشان کاهش مییابد. اما CLAP با اضافه کردن توضیحات متنی قبل از دستورات حرکتی، اجازه میدهد مدل بدون تغییر در ساختار اصلی، به بهترین نحو یاد بگیرد چگونه با محیط تعامل کند.
نتایج آزمایشها روی مجموعه داده LIBERO فوقالعاده بوده و دقت این مدل را تا حد زیادی بهبود بخشیده است. این دستاورد میتواند گامی بزرگ برای هوشمندتر شدن رباتهای خانگی و صنعتی باشد.
منبع: arXiv AI
