محققان به راهکار جذابی برای حل مشکل «فروپاشی سیاست» (Policy Collapse) در آموزش مدلهای هوش مصنوعی دست یافتهاند. وقتی مدلهای زبانی در حین آموزش به صورت غیرهمگام (Asynchronous) بهینه میشوند، دادههای قدیمی میتوانند باعث اختلال در یادگیری شوند.
مدل جدیدی به نام «Entropy-Scaled Trust Region» یا به اختصار ESTR معرفی شده که با استفاده از آنتروپی توکنها، نویزهای ناشی از یادگیری غیرهمگام را شناسایی و اصلاح میکند. این روش باعث شده تا دقت مدلها در انجام کارهای منطقی و ریاضیاتی نسبت به روشهای سنتی به شکل قابل توجهی بهبود یابد. قدمی دیگر برای رسیدن به ایجنتهای هوشمندتر و پایدارتر! 🧠✨
منبع: arXiv AI
