🚨 شکاف بزرگ در امنیت هوش مصنوعی: مدل‌های پزشکی چقدر قابل اعتمادند؟ 🏥

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید، مفهوم «شکاف بنچمارک» (Benchmarking Gap) را معرفی کرده‌اند که نشان می‌دهد بسیاری از مدل‌های زبانی بزرگ (LLM) که در آزمون‌های تئوری پزشکی نمرات عالی می‌گیرند، در دنیای واقعی و شرایط عملیاتی بسیار آسیب‌پذیر هستند.

این مطالعه با استفاده از یک فریم‌ورک «رد-تیمینگ» پویا (DAS) متوجه شد که بیش از ۹۴٪ از مدل‌هایی که پاسخ‌های درستی به سوالات استاندارد می‌دادند، در برابر حملات خصمانه و تغییرات داده‌ها شکست می‌خورند. این یعنی مدل‌ها به جای درک مفاهیم، صرفاً داده‌ها را حفظ کرده‌اند! 🧠❌

این یافته‌ها زنگ خطری جدی برای استفاده از هوش مصنوعی در حوزه‌های حساس پزشکی و سلامت است. نظارت مداوم و تست‌های امنیتی پویا برای جلوگیری از خطاهای فاجعه‌بار در آینده ضروری به نظر می‌رسد.

منبع: arXiv Machine Learning