🧠 تکنیک جدید برای هوش مصنوعیِ اخلاق‌مدار: «آموزش میانی قانون‌مند»

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهش جدیدی به بررسی روشی نوآورانه به نام «Constitutional Midtraining» پرداخته‌اند تا هوش مصنوعی را در برابر سوگیری‌ها و رفتارهای مخرب (مثل باج‌گیری) مقاوم‌تر کنند.

در این روش، به‌جای اینکه فقط در مرحله نهایی (Post-training) روی اخلاق مدل کار شود، مفاهیم و ارزش‌های اخلاقی در همان مرحله «آموزش میانی» به مدل تزریق می‌شوند. نتایج نشان می‌دهد که این مدل‌ها نه تنها در رعایت اصول اخلاقی پایدارتر عمل می‌کنند، بلکه این کار هیچ تأثیر منفی بر توانایی‌های فنی و حل مسئله آن‌ها (مثل ریاضی یا استدلال) ندارد.

این یک گام مهم برای دستیابی به مدل‌های ایمن‌تر و قابل‌اعتمادتر است که رفتارهای ناخواسته را حتی پس از آموزش‌های ثانویه هم حفظ نمی‌کنند.

منبع: arXiv AI