🚀 بهینه‌سازی حرفه‌ای مدل‌های زبانی: معرفی متد جدید ESTR

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به راهکار جذابی برای حل مشکل «فروپاشی سیاست» (Policy Collapse) در آموزش مدل‌های هوش مصنوعی دست یافته‌اند. وقتی مدل‌های زبانی در حین آموزش به صورت غیرهمگام (Asynchronous) بهینه می‌شوند، داده‌های قدیمی می‌توانند باعث اختلال در یادگیری شوند.

مدل جدیدی به نام «Entropy-Scaled Trust Region» یا به اختصار ESTR معرفی شده که با استفاده از آنتروپی توکن‌ها، نویزهای ناشی از یادگیری غیرهمگام را شناسایی و اصلاح می‌کند. این روش باعث شده تا دقت مدل‌ها در انجام کارهای منطقی و ریاضیاتی نسبت به روش‌های سنتی به شکل قابل توجهی بهبود یابد. قدمی دیگر برای رسیدن به ایجنت‌های هوشمندتر و پایدارتر! 🧠✨

منبع: arXiv AI