یکی از چالشهای بزرگ در دنیای «مدلهای متنباز» و روشهای شخصیسازی (مانند LoRA)، سوءاستفاده از آنها برای تولید محتوای نامناسب است. اما محققان به تازگی روشی ابداع کردهاند که میتواند مدلهای مخرب را تنها با بررسی «وزنهای شبکه» شناسایی کند!
🔹 نکته کلیدی این پژوهش این است که به جای انتظار برای تولید خروجیهای غیرقانونی (که خودش یک ریسک امنیتی است)، میتوان اثر انگشت منحصربهفردی از تغییرات ایجاد شده در وزنهای LoRA به دست آورد. این یعنی غربالگری محتوای مضر میتواند بسیار سریعتر و بدون نیاز به تولید تصویر انجام شود.
این پیشرفت نه تنها دقت سیستمهای نظارتی را بالا میبرد، بلکه گامی رو به جلو برای ایمنسازی اکوسیستم هوش مصنوعی است.
منبع: arXiv Machine Learning
