محققان به تازگی راهکار هوشمندانهای به نام TACO معرفی کردهاند که مشکل بزرگ آموزش مدلهای زبانی با یادگیری تقویتی (RL) را حل میکند. تا پیش از این، روشهای رایج بهطور یکسان به تمام توکنهای خروجی پاداش میدادند که باعث میشد مدل گاهی توکنهای غلط و غیرمنطقی را هم به عنوان پاسخ درست یاد بگیرد (مشکل Positive-Credit Contamination).
روش جدید TACO با ارزیابی «خطر توکنهای دُم» (Tail-risk)، متوجه میشود که کدام بخش از پاسخ مدل واقعاً ارزشمند است و کدام بخش صرفاً نویز یا خطاست. این کار باعث میشود پایداری آموزش مدلهای هوش مصنوعی بسیار بیشتر شده و در استدلالهای طولانی، خروجیهای دقیقتری ارائه دهند.
این پیشرفت میتواند مسیر را برای داشتن مدلهای هوش مصنوعی با استدلالهای منطقیتر و خطای کمتر هموار کند. 💡
منبع: arXiv Machine Learning
