محققان در پژوهشی جدید، مفهوم «شکاف بنچمارک» (Benchmarking Gap) را معرفی کردهاند که نشان میدهد بسیاری از مدلهای زبانی بزرگ (LLM) که در آزمونهای تئوری پزشکی نمرات عالی میگیرند، در دنیای واقعی و شرایط عملیاتی بسیار آسیبپذیر هستند.
این مطالعه با استفاده از یک فریمورک «رد-تیمینگ» پویا (DAS) متوجه شد که بیش از ۹۴٪ از مدلهایی که پاسخهای درستی به سوالات استاندارد میدادند، در برابر حملات خصمانه و تغییرات دادهها شکست میخورند. این یعنی مدلها به جای درک مفاهیم، صرفاً دادهها را حفظ کردهاند! 🧠❌
این یافتهها زنگ خطری جدی برای استفاده از هوش مصنوعی در حوزههای حساس پزشکی و سلامت است. نظارت مداوم و تستهای امنیتی پویا برای جلوگیری از خطاهای فاجعهبار در آینده ضروری به نظر میرسد.
منبع: arXiv Machine Learning
