🛡 حمله جدید به مدل‌های زبانی: JUMP راه را پیدا کرد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان تکنیک قدرتمندی به نام JUMP برای نفوذ و شناسایی داده‌های آموزشی در مدل‌های «انتشار گسسته» (dLLM) ابداع کرده‌اند. برخلاف روش‌های قدیمی که بسیار کُند و پرهزینه بودند، این متد جدید می‌تواند تنها با یک «پاس» (Single-pass)، نقاط ضعف مدل را شناسایی کرده و تشخیص دهد که آیا یک داده خاص در آموزش مدل نقش داشته است یا خیر.

این دستاورد نه تنها دقت شناسایی را از ۰.۸۲ به ۰.۹۰ افزایش داده، بلکه نشان می‌دهد چقدر مدل‌های زبانیِ مبتنی بر Diffusion نسبت به حملات استنتاج عضو (MIA) آسیب‌پذیر هستند. گامی جدید برای افزایش امنیت مدل‌های هوش مصنوعی! 🔐

منبع: arXiv AI