محققان به تازگی برای حل چالشهای ارزیابی امنیت مدلهای زبانی (LLMs)، فریمورک جدیدی به نام «Adversarial Pragmatics» معرفی کردهاند. این روش کمک میکند تا بفهمیم مدلها در شرایط پیچیده مثل تضاد دستورات یا ابهامات زبانی، دقیقاً چگونه رفتار میکنند.
تفاوت این رویکرد با بنچمارکهای ساده «قبول/رد» این است که به جای یک برچسب کلی، خروجیهای مدل را از جنبههای مختلف مثل پایبندی به سیاستها، ریسکپذیری و اعتمادبهنفس بهصورت جداگانه بررسی میکند. این ابزار برای متخصصان امنیت و توسعهدهندگان هوش مصنوعی گام بزرگی در جهت درک بهتر رفتارهای غیرمنتظره مدلهاست. 🛡️💡
منبع: arXiv AI
