🧠 رمزگشایی از یادگیری ترجیحی (RLHF) در مدل‌های هوش مصنوعی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید به سراغ ساختار درونی مدل‌های هوش مصنوعی رفته‌اند تا ببینند وقتی مدل‌ها را با روش‌های «یادگیری تقویتی بر اساس بازخورد انسانی» (RLHF) آموزش می‌دهیم، در سطح پارامترها چه اتفاقی می‌افتد.

نکته کلیدی این تحقیق کشف یک ساختار «سر-دم» در آپدیت‌های مدل است. آن‌ها متوجه شدند که تغییرات رفتاری مدل عمدتاً در یک بخش کوچک (سر) متمرکز است، در حالی که بخش باقی‌مانده (دم) برای درک کامل و عملکردهای خاص ضروری است. این دستاورد به مهندسان کمک می‌کند تا به جای تغییر کل مدل، بتوانند مداخلات دقیق‌تری روی بخش‌های خاصی از آپدیت‌های یادگیری داشته باشند. 🛠️✨

منبع: arXiv AI