محققان در مطالعهای جدید، روشی نوآورانه به نام «LBA» را برای حملات خصمانه (Adversarial Attacks) علیه مدلهای زبانی معرفی کردهاند.
مشکل اصلی روشهای قدیمی این بود که برای پیدا کردن حفرههای امنیتی یا تولید متنهای گمراهکننده، نیاز به تعداد زیادی پرسوجو (Query) داشتند که هم هزینهبر بود و هم دقت پایینی داشت. اما LBA با استفاده از یک رویکرد «نمونهبرداری هوشمند» که دانش پیشین و پسین را ترکیب میکند، میتواند با کمترین تعداد پرسوجو، بهترین نمونههای خصمانه را شناسایی کند.
این روش نه تنها دقیقتر است، بلکه متنهای تولید شده توسط آن، از نظر معنایی هم برای انسان قابلفهمتر هستند. گامی جدید برای شناسایی ضعفهای امنیتی مدلهای هوش مصنوعی! 🤖💡
منبع: arXiv NLP
