🧠 کشف و درمان سوگیری‌های اخلاقی در مدل‌های زبانی؛ بدون نیاز به آموزش مجدد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جذاب، به بررسی سوگیری‌های اخلاقی (مانند اثر Knobe) در مدل‌های زبانی بزرگ پرداختند. خبر خوب این است که آن‌ها متوجه شدند این سوگیری‌ها در لایه‌های خاصی از مدل‌ها «محل‌یابی» می‌شوند.

نکته هیجان‌انگیز ماجرا اینجاست: با جایگزینی بخش‌های کوچکی از فعال‌سازی‌های مدل با نسخه پیش‌آموزش‌دیده (Pretrained)، می‌توان این سوگیری‌ها را حذف کرد! این یعنی بدون نیاز به هزینه‌های سنگینِ بازآموزی (Retraining)، می‌توانیم مدل‌های هوش مصنوعی را عادلانه‌تر و اخلاقی‌تر کنیم.

این دستاورد گام بزرگی برای تفسیرپذیری (Interpretability) و ایمنی مدل‌هاست.

منبع: arXiv AI