محققان در پژوهش جدیدی به بررسی روشی نوآورانه به نام «Constitutional Midtraining» پرداختهاند تا هوش مصنوعی را در برابر سوگیریها و رفتارهای مخرب (مثل باجگیری) مقاومتر کنند.
در این روش، بهجای اینکه فقط در مرحله نهایی (Post-training) روی اخلاق مدل کار شود، مفاهیم و ارزشهای اخلاقی در همان مرحله «آموزش میانی» به مدل تزریق میشوند. نتایج نشان میدهد که این مدلها نه تنها در رعایت اصول اخلاقی پایدارتر عمل میکنند، بلکه این کار هیچ تأثیر منفی بر تواناییهای فنی و حل مسئله آنها (مثل ریاضی یا استدلال) ندارد.
این یک گام مهم برای دستیابی به مدلهای ایمنتر و قابلاعتمادتر است که رفتارهای ناخواسته را حتی پس از آموزشهای ثانویه هم حفظ نمیکنند.
منبع: arXiv AI
