محققان تکنیک نوآورانهای به نام «C-ΔΘ» معرفی کردهاند که انقلابی در امنیت مدلهای زبانی ایجاد میکند. تا امروز، برای اعمال سیاستهای امنیتی و جلوگیری از تولید محتوای نامناسب، مجبور بودیم در حین اجرا (Inference) از ابزارهای کنترلی استفاده کنیم که سرعت و هزینه پردازش را افزایش میدادند.
اما این روش جدید چه میکند؟
به جای دخالت در زمان پاسخدهی، محققان با استفاده از شناسایی «مدارهای عصبی» مسئولِ تولید محتوای خاص، وزنهای مدل را به صورت آفلاین و بسیار دقیق (کمتر از ۵٪ پارامترها) ویرایش میکنند. نتیجه؟ مدلی که بدون نیاز به ابزارهای جانبی، دقیقاً طبق سیاستهای امنیتی شما عمل میکند و هیچ هزینه اضافه در زمان اجرا ندارد! 🚀
این پیشرفت گام بزرگی برای کاربردیتر و بهینهتر کردن مدلهای بزرگ در سطح تجاری است.
منبع: arXiv NLP
