آیا تا به حال فکر کردهاید که مدلهای هوش مصنوعی پس از آموزش دیدن (Fine-tuning)، چه رفتارهای مخفی یا سوگیریهای ناخواستهای را در خود جای میدهند؟
محققان ابزار جدیدی به نام «SAR» معرفی کردهاند که مانند یک ذرهبین عمل میکند! این آداپتور سبک به توسعهدهندگان اجازه میدهد تا بفهمند مدل دقیقاً چه چیزی یاد گرفته و آیا رفتارهای آسیبزا یا سوگیریهای پنهانی در آن شکل گرفته یا خیر. این ابزار در مقایسه با روشهای قبلی، بسیار دقیقتر عمل کرده و نرخ خطای گزارشهای غلط (Hallucination) را به نصف کاهش داده است. یک گام بزرگ برای شفافیت و ایمنی بیشتر در توسعه مدلهای AI! 🛡️🤖
منبع: arXiv AI
