🛡️ راهکار جدید برای جلوگیری از «رفتارهای پنهان» در مدل‌های زبانی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی به سراغ یکی از بزرگترین چالش‌های امنیت در هوش مصنوعی رفته‌اند: جلوگیری از رفتارهای مخرب و پنهانی که هنگام آموزش یا Fine-tuning مدل‌ها تزریق می‌شوند.

این روش که با نام «Inference-Time Consensus» معرفی شده، به جای اعتماد به یک منبع آموزشی، از چندین مدل مرجع استفاده می‌کند. در زمان تولید متن، مدل‌ها با هم به «اجماع» می‌رسند و اگر یک منبع داده مخرب باشد، مدل‌ها آن رفتار را فیلتر کرده و خروجی سالم‌تری ارائه می‌دهند. این یعنی امنیت بیشتر و جلوگیری از نفوذ رفتارهای ناخواسته به مدل‌های هوش مصنوعی. 🚀

منبع: arXiv AI