محققان روش نوآورانهای به نام TOPReward معرفی کردهاند که یادگیری رباتها را متحول میکند. برخلاف روشهای سنتی که نیاز به دادههای آموزشی حجیم یا برچسبگذاری دستی داشتند، این متد از توانایی ذاتی مدلهای بصری-زبانی (VLMs) استفاده میکند.
با تحلیل احتمالات درونی توکنهای این مدلها، ربات میتواند بفهمد که آیا در مسیر انجام یک وظیفه خاص (مانند جابجایی اشیاء) موفق بوده یا خیر. این یعنی:
✅ عدم نیاز به آموزش مدل پاداش (Reward Model) جداگانه
✅ عملکرد بسیار دقیق در محیطهای واقعی و تستشده روی ۱۳۰ وظیفه متفاوت
✅ یک قدم بزرگ دیگر برای خودکارسازی حرکت و هوش فیزیکی رباتها
این پیشرفت میتواند به زودی رباتهای خانگی و صنعتی را بسیار هوشمندتر از قبل کند. نظر شما چیست؟ آیا هوش مصنوعی بالاخره توانایی درک کامل محیط فیزیکی را پیدا میکند؟
منبع: arXiv AI
