محققان در پژوهشی جذاب، به بررسی سوگیریهای اخلاقی (مانند اثر Knobe) در مدلهای زبانی بزرگ پرداختند. خبر خوب این است که آنها متوجه شدند این سوگیریها در لایههای خاصی از مدلها «محلیابی» میشوند.
نکته هیجانانگیز ماجرا اینجاست: با جایگزینی بخشهای کوچکی از فعالسازیهای مدل با نسخه پیشآموزشدیده (Pretrained)، میتوان این سوگیریها را حذف کرد! این یعنی بدون نیاز به هزینههای سنگینِ بازآموزی (Retraining)، میتوانیم مدلهای هوش مصنوعی را عادلانهتر و اخلاقیتر کنیم.
این دستاورد گام بزرگی برای تفسیرپذیری (Interpretability) و ایمنی مدلهاست.
منبع: arXiv AI
