📊 بنچمارک جدید برای ارزیابی دقیق‌تر هوش مصنوعی در حوزه سلامت زنان

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی بزرگ (LLMs) روز به روز بیشتر برای توصیه‌های پزشکی مورد استفاده قرار می‌گیرند، اما آیا واقعاً در حوزه سلامت زنان قابل اعتماد هستند؟

محققان به تازگی بنچمارک جدیدی به نام «WHBench» را معرفی کرده‌اند که شامل ۴۷ سناریوی تخصصی برای بررسی عملکرد مدل‌ها در موضوعات حساس سلامت زنان است. نتایج این ارزیابی نشان می‌دهد که حتی بهترین مدل‌های فعلی هم در تشخیص‌های دقیق و توصیه‌های ایمن با چالش‌های جدی روبرو هستند و هیچ‌کدام نتوانسته‌اند نمره‌ای بالاتر از ۷۵ درصد کسب کنند.

این بنچمارک کمک می‌کند تا ضعف‌های مدل‌ها در زمینه‌هایی مثل دستورالعمل‌های قدیمی، خطاهای دوز دارویی و مسائل مربوط به عدالت در سلامت شناسایی شود تا شاهد مدل‌های ایمن‌تری در آینده باشیم.

منبع: arXiv AI