محققان به تازگی چارچوب جدیدی معرفی کردهاند که میتواند با استفاده از مدلهای آماری دقیق، احتمال تولید خروجیهای مضر توسط مدلهای زبانی بزرگ (LLM) را به صورت علمی تخمین بزند.
🔹 این روش با استفاده از تکنیکهای ریاضی پیشرفته، حتی زمانی که احتمال وقوع خطا بسیار کم است، محدودههای قابلاعتمادی (Lower Bounds) ارائه میدهد.
🔹 اهمیت این دستاورد در این است که به جای حدس و گمان، ما را به سمت «گواهینامههای آماری» برای تایید ایمنی مدلها پیش میبرد؛ چیزی که برای کاربردهای حساس هوش مصنوعی در آینده حیاتی است.
این تحقیق گام بزرگی برای کاهش نگرانیها درباره رفتارهای پیشبینینشده مدلهای زبانی بزرگ محسوب میشود.
منبع: arXiv NLP
