محققان روش جدیدی به نام DREvo ابداع کردهاند که انقلابی در «خود-تکاملی» (Self-Evolution) عاملهای هوشمند ایجاد میکند.
مشکل روشهای فعلی این بود که در مسیر یادگیری، تجربیات گذشته را به درستی درک نمیکردند و عملکردشان نوسان زیادی داشت. اما DREvo با استفاده از «لنگر انداختن بر شواهد عملکردی» (Function-level evidence anchoring) و کالیبرهکردن وضعیتها، باعث میشود عاملها به شکل پایدارتر و هوشمندانهتری یاد بگیرند و تکامل یابند.
نتایج نشان میدهد که DREvo با بودجه کمتر، عملکرد بهتری نسبت به روشهای مشابه داشته و در ۵ بنچمارک مختلف، پیشتاز بوده است. این یعنی یک گام مهم دیگر به سوی ساخت Agentهای دقیقتر و قابلاطمینانتر برای دنیای واقعی!
منبع: arXiv Machine Learning
