یکی از بزرگترین چالشهای مدلهای متنباز (Open-Weight)، امکان تغییر رفتار آنها توسط کاربران با استفاده از فاینتیونینگ (Fine-tuning) مخرب است؛ مثلاً تبدیل یک دستیار هوشمند به ابزاری برای تولید محتوای خطرناک یا کدهای مخرب.
محققان در مقاله جدیدی روشی به نام «HarmAlign» معرفی کردهاند که بدون آسیب زدن به یادگیری قابلیتهای مفید مدل، جلوی یادگیری رفتارهای مضر را میگیرد. این روش با کنترل هوشمندانه انحنای تابع هزینه (Curvature Control)، عملاً راه سوءاستفاده از مدلهای هوش مصنوعی را میبندد و امنیت مدلها را بهطور قابل توجهی بالا میبرد. گامی بزرگ برای دنیای مدلهای متنباز که میخواهند هم منعطف باشند و هم امن! 🧠✨
منبع: arXiv Machine Learning
