محققان در مطالعه جدیدی رویکردی نوآورانه به نام «یادگیری تجربی» (Experiential Learning) را معرفی کردهاند که نحوه آموزش LLMها را دگرگون میکند.
تا پیش از این، ارزیابی مدلها اغلب به امتیازهای عددی ساده خلاصه میشد که باعث میشد بازخوردهای متنی ارزشمند نادیده گرفته شوند. اما حالا، مدل هوش مصنوعی به جای یک «داور» (Judge)، در نقش یک «مربی» (Coach) عمل میکند. این مربی، بازخوردها را به دانش تجربی تبدیل کرده و آن را به مدل تزریق میکند.
این روش نه تنها باعث دقت بیشتر و درک بهتر ظرافتهای زبانی میشود، بلکه مشکل «پاداشدهی کاذب» (Reward Hacking) را نیز تا حد زیادی کاهش میدهد. قدمی بزرگ به سمت مدلهایی که واقعاً «میآموزند» نه فقط «حفظ میکنند»! 💡
منبع: arXiv Machine Learning
