محققان در یک پژوهش جدید، به بررسی دقیق یکی از چالشهای بزرگ مدلهای زبانی پرداختهاند: «شکست در تعمیمدهی» (Generalization Failure).
این تیم تحقیقاتی متوجه شده که فرآیند آموزش با یادگیری تقویتی (RL) گاهی باعث میشود مدلها فقط روی دادههای تمرینی متمرکز شوند و تواناییشان در مواجهه با شرایط مشابه اما متفاوت، کاملاً از بین برود. در واقع، مدل یاد میگیرد که برای یک سوال خاص، فقط یک پاسخ خاص بدهد و اگر شرایط کمی تغییر کند، عملکردش به صفر میرسد! این یافتهها به ما کمک میکند تا بهتر بفهمیم چطور مدلهای پایدارتر و هوشمندتری بسازیم که در دنیای واقعی دچار چنین خطاهای عجیبی نشوند. 🤖💡
منبع: arXiv AI
