محققان در مقاله جدیدی به سراغ یکی از بزرگترین چالشهای امنیت در هوش مصنوعی رفتهاند: جلوگیری از رفتارهای مخرب و پنهانی که هنگام آموزش یا Fine-tuning مدلها تزریق میشوند.
این روش که با نام «Inference-Time Consensus» معرفی شده، به جای اعتماد به یک منبع آموزشی، از چندین مدل مرجع استفاده میکند. در زمان تولید متن، مدلها با هم به «اجماع» میرسند و اگر یک منبع داده مخرب باشد، مدلها آن رفتار را فیلتر کرده و خروجی سالمتری ارائه میدهند. این یعنی امنیت بیشتر و جلوگیری از نفوذ رفتارهای ناخواسته به مدلهای هوش مصنوعی. 🚀
منبع: arXiv AI
