محققان در مقالهای جدید، روشی نوآورانه به نام «ATOD» (تقطیر آنیِ نوبتمحور) را برای آموزش ایجنتهای هوش مصنوعی معرفی کردهاند که انقلابی در یادگیری آنها ایجاد میکند.
این روش با ترکیب دو رویکردِ «تقلید از معلم» (OPD) و «یادگیری تقویتی» (RL)، به ایجنتها کمک میکند نه تنها سریعتر یاد بگیرند، بلکه در محیطهای پیچیده و تعاملی نیز عملکردی بسیار فراتر از مدلهای پایه ارائه دهند.
طبق آزمایشها، این تکنیک در وظایف طولانیمدت (مثل محیطهای شبیهسازی ALFWorld و WebShop)، توانسته تا ۲۳ واحد دقت مدلها را نسبت به روشهای مشابه بهبود ببخشد و حتی از مدلهای «معلم» خود نیز پیشی بگیرد. قدمی بزرگ برای ساخت ایجنتهایی که واقعاً هوشمندتر عمل میکنند! 🤖✨
منبع: arXiv AI
