آموزش ایجنتهایی که از رابطهای کاربری (GUI) استفاده میکنند، همیشه با چالش «ارزیابی عملکرد» روبرو بوده است. مدلهای قبلی یا به قوانین سختگیرانه وابسته بودند و یا دقت کافی نداشتند. حالا چارچوب جدید SeekJudge با استفاده از یک مدل ۹ میلیارد پارامتری بهینه، توانسته اولین سیستم پاداش مبتنی بر مدل باشد که در یادگیری تقویتی (RL)، عملکردی بهتر یا برابر با داورهای سنتی دارد.
این یعنی ایجنتهای آینده در محیطهای پیچیده کامپیوتری، بسیار دقیقتر، سریعتر و ارزانتر آموزش میبینند. گامی مهم برای هوشمندتر شدن خودکارسازی کارهای روزمره در سیستمعاملها! 🚀
نویسی
منبع: arXiv AI
