محققان بهتازگی چارچوب جدیدی برای شناسایی نقاط ضعف مدلهای زبانی بزرگ (LLM) طراحی کردهاند که تمرکز ویژهای بر «قابلیت اعتماد» (Faithfulness) دارد. 🔍
در این روش که از معماری «تارگت، مهاجم و داور» استفاده میکند، مدلهای مهاجم با طراحی پرامپتهای خصمانه، سعی میکنند خطاهای مدل هدف را افشا کنند و مدل داور نیز دقت پاسخها را به دقت بررسی میکند.
نکته جالب اینجاست که طبق این مطالعه، معماری و ساختار مدل در تأمین امنیت، نقش بسیار پررنگتری نسبت به تعداد پارامترها (مقیاس) ایفا میکند. این ابزار حتی قابلیت ارزیابی مدلها در زبانهای مختلف از جمله فارسی و عربی را دارد و گامی مهم در افزایش اطمینان از خروجیهای هوش مصنوعی در کاربردهای حساس محسوب میشود. 🤖✨
منبع: arXiv AI
