مدلهای بینایی-زبان-عمل (VLA) همیشه با کمبود دادههای برچسبگذاری شده برای رباتها دستوپنج نرم کردهاند. اما حالا محققان با معرفی مدل جدید DLAM، راهکار جالبی پیدا کردند!
این مدل با استفاده از ویدیوهای بدون برچسب، یاد میگیرد که چطور تغییرات فیزیکی محیط را درک کند. DLAM به جای مدلهای قطعی و خشک، از توزیعهای احتمالی (Gaussian) برای پیشبینی دقیقتر حرکات استفاده میکند که باعث میشود رباتها در محیطهای واقعی، رفتاری بسیار پایدارتر و هوشمندانهتر داشته باشند.
این یعنی در آیندهای نزدیک، رباتهایی که با این روش آموزش میبینند، در انجام کارهای پیچیده انسانی بسیار دقیقتر عمل خواهند کرد. 🚀
منبع: arXiv AI
