محققان در مقالهای جدید به سراغ ساختار درونی مدلهای هوش مصنوعی رفتهاند تا ببینند وقتی مدلها را با روشهای «یادگیری تقویتی بر اساس بازخورد انسانی» (RLHF) آموزش میدهیم، در سطح پارامترها چه اتفاقی میافتد.
نکته کلیدی این تحقیق کشف یک ساختار «سر-دم» در آپدیتهای مدل است. آنها متوجه شدند که تغییرات رفتاری مدل عمدتاً در یک بخش کوچک (سر) متمرکز است، در حالی که بخش باقیمانده (دم) برای درک کامل و عملکردهای خاص ضروری است. این دستاورد به مهندسان کمک میکند تا به جای تغییر کل مدل، بتوانند مداخلات دقیقتری روی بخشهای خاصی از آپدیتهای یادگیری داشته باشند. 🛠️✨
منبع: arXiv AI
