یکی از بزرگترین مشکلات در آموزش مدلهای زبانی (LLM) با استفاده از یادگیری تقویتی (RL)، ناپایداری و پدیدهای به نام «بهینهسازی بیش از حد» است که باعث میشود مدل در نهایت قدرت استدلال کلی خود را از دست بدهد.
محققان به تازگی چارچوب جدیدی به نام ARMOR معرفی کردهاند که با استفاده از «نمونههای لنگر» (Anchor Samples)، اجازه نمیدهد مدل در طول آموزش از مسیر اصلی خارج شود. این روش به مدل کمک میکند بدون نیاز به جریمههای پیچیده، ثبات خود را حفظ کند و در بنچمارکهای استدلال، عملکرد بسیار پایدارتر و دقیقتری داشته باشد.
این یعنی در آینده نزدیک، مدلهای هوش مصنوعی با آموزشهای بهینهتر، باهوشتر و قابلاطمینانتر خواهند شد! 🧠💡
منبع: arXiv AI
