🚀 نوآوری جدید در آموزش مدل‌های زبانی: معرفی روش TACO

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی راهکار هوشمندانه‌ای به نام TACO معرفی کرده‌اند که مشکل بزرگ آموزش مدل‌های زبانی با یادگیری تقویتی (RL) را حل می‌کند. تا پیش از این، روش‌های رایج به‌طور یکسان به تمام توکن‌های خروجی پاداش می‌دادند که باعث می‌شد مدل گاهی توکن‌های غلط و غیرمنطقی را هم به عنوان پاسخ درست یاد بگیرد (مشکل Positive-Credit Contamination).

روش جدید TACO با ارزیابی «خطر توکن‌های دُم» (Tail-risk)، متوجه می‌شود که کدام بخش از پاسخ مدل واقعاً ارزشمند است و کدام بخش صرفاً نویز یا خطاست. این کار باعث می‌شود پایداری آموزش مدل‌های هوش مصنوعی بسیار بیشتر شده و در استدلال‌های طولانی، خروجی‌های دقیق‌تری ارائه دهند.

این پیشرفت می‌تواند مسیر را برای داشتن مدل‌های هوش مصنوعی با استدلال‌های منطقی‌تر و خطای کمتر هموار کند. 💡

منبع: arXiv Machine Learning