محققان به تازگی معماری جدیدی معرفی کردند که در آن، مدلهای زبانی (LLM) به عنوان استراتژیست اصلی عمل کرده و تیمهای رباتیک را هدایت میکنند. در این سیستم، LLM تصمیمات کلان میگیرد و مدلهای یادگیری تقویتی (RL) اجرای دقیق دستورات را بر عهده دارند.
نتایج این تحقیق در محیطهای رقابتی بازیها نشان میدهد که این ترکیب، هم قدرت عمل بسیار بالایی دارد و هم از نظر رفتار انسانی، بسیار باورپذیرتر از روشهای سنتی ظاهر شده است. این یعنی دیگر نیازی به کدنویسی دستی قوانین پیچیده برای عاملهای هوشمند نیست!
منبع: arXiv Machine Learning
