محققان ابزار جدیدی به نام «BioSecBench-Surveillance» معرفی کردهاند که به طور اختصاصی برای سنجش توانایی عاملهای هوش مصنوعی (AI Agents) در تحلیل دادههای ژنومیک طراحی شده است. 🔍
این بنچمارک با ۱۰۰ تست دقیق، بررسی میکند که آیا هوش مصنوعی میتواند همانند یک تحلیلگر انسانی، دادههای خام ژنتیکی را پردازش کرده و تشخیصهای درستی در زمینههایی مثل دستکاریهای ژنتیکی ارائه دهد یا خیر. نتایج اولیه نشان میدهد که حتی قویترین مدلهای فعلی (مانند Opus 4.8 و GPT-5.5) در حدود نیمی از تستها دچار خطا میشوند که نشان میدهد هنوز مسیر طولانی برای اعتماد کامل به هوش مصنوعی در حوزه نظارتهای بیولوژیکی داریم. 📊
منبع: arXiv AI
