یکی از چالشهای بزرگ مدلهای متنباز (Open-Source)، پاک شدن واترمارکها پس از تغییرات در مدل یا ترکیب آنها (Model Merging) است. اما خبر خوب این است که محققان با معرفی روش جدیدی به نام «Merge-Adversarial Training»، موفق شدند واترمارکهایی بسازند که حتی پس از ترکیب مدلها نیز از بین نمیروند.
این دستاورد یک گام کلیدی برای امنیت و تشخیص اصالت مدلهای زبانی است تا از سوءاستفادههای احتمالی جلوگیری شود. در تستهای انجام شده، این روش عملکرد بسیار بهتری نسبت به مدلهای قبلی داشته و در عین حال تواناییهای اصلی مدل را نیز حفظ کرده است.
منبع: arXiv AI
