مدلهای زبانی در انجام کارهای پیچیده و طولانیمدت هنوز هم چالشهایی دارند. روشهای فعلی معمولاً بر اجرای تکمرحلهای (ReAct) متکی هستند که در استراتژیهای بلندمدت کم میآورند.
محققان برای حل این مشکل، پارادایم جدیدی به نام AdaPlan را معرفی کردهاند که با ترکیب «برنامهریزی جهانی» و «اجرای دقیق»، به هوش مصنوعی کمک میکند تا برای حل مسائل پیچیده، اول نقشه بکشد و بعد عمل کند!
فریمورک PilotRL هم بر پایه یادگیری تقویتی (Reinforcement Learning) طراحی شده تا به مدل یاد بدهد چطور این برنامهها را به بهترین شکل دنبال و بهینهسازی کند. این یعنی در آینده شاهد ایجنتهای هوشمندتری خواهیم بود که کمتر دچار سردرگمی میشوند. 🧠✨
منبع: arXiv NLP
