محققان در مقاله جدیدی مدل جذابی به نام CoTinyVLA را معرفی کردهاند که دنیای «مدلهای بینایی-زبانی-کنشی» (VLA) را تغییر میدهد.
چالش اصلی اینجاست: مدلهای کنونی برای روباتیک بسیار سنگین هستند، اما این مدل با داشتن تنها ۰.۹ میلیارد پارامتر، به راحتی روی سیستمهای تعبیهشده (Embedded) اجرا میشود.
نکات کلیدی این دستاورد:
✅ بهرهگیری از استدلال زنجیرهای (CoT) برای درک بهتر مراحل کار.
✅ عملکرد فوقالعاده در محیطهای دشوار و شکست دادن مدلهای سنگینتر (۷ میلیاردی).
✅ افزایش دقت در شناسایی اشیاء و اهداف با استفاده از استراتژیهای جدیدِ دادهمحور.
این یعنی در آیندهای نزدیک، رباتهای ارزانتر و هوشمندتر را در محیطهای واقعی بیشتر خواهیم دید! 🦾
منبع: arXiv AI
