با پیشرفت مدلهای زبانی، نگرانیها درباره استفاده نادرست از آنها در حوزههای حساس علمی (مثل شیمی یا زیستشناسی) افزایش یافته است. محققان به تازگی بنچمارک جدیدی به نام «SciHazard» را معرفی کردهاند که به طور اختصاصی برای ارزیابی ریسکهای علمی مدلهای هوش مصنوعی طراحی شده است.
نکات کلیدی این دستاورد:
🔹 این بنچمارک شامل ۲۴۰۰ سوال چالشبرانگیز در ۱۲ رشته علمی است.
🔹 معیار جدید DeHarm-Score برای سنجش میزان خطر و قابلیت اجرای پاسخهای هوش مصنوعی استفاده میشود.
🔹 نتایج نشان میدهد که «ایجنتهای خودمختار» (Deep Research Agents) نسبت به مدلهای معمولی، ریسک بالاتری در ارائه اطلاعات حساس دارند.
این تحقیق گام مهمی در جهت ایمنسازی هوش مصنوعی برای کاربردهای پیشرفته علمی و جلوگیری از سوءاستفادههای احتمالی است. ✅
منبع: arXiv AI
