🧬 بنچمارک جدید برای ارزیابی هوش مصنوعی در حوزه زیست‌شناسی و سلامت

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان ابزار جدیدی به نام «BioSecBench-Surveillance» معرفی کرده‌اند که به طور اختصاصی برای سنجش توانایی عامل‌های هوش مصنوعی (AI Agents) در تحلیل داده‌های ژنومیک طراحی شده است. 🔍

این بنچمارک با ۱۰۰ تست دقیق، بررسی می‌کند که آیا هوش مصنوعی می‌تواند همانند یک تحلیل‌گر انسانی، داده‌های خام ژنتیکی را پردازش کرده و تشخیص‌های درستی در زمینه‌هایی مثل دستکاری‌های ژنتیکی ارائه دهد یا خیر. نتایج اولیه نشان می‌دهد که حتی قوی‌ترین مدل‌های فعلی (مانند Opus 4.8 و GPT-5.5) در حدود نیمی از تست‌ها دچار خطا می‌شوند که نشان می‌دهد هنوز مسیر طولانی برای اعتماد کامل به هوش مصنوعی در حوزه نظارت‌های بیولوژیکی داریم. 📊

منبع: arXiv AI