مدلهای زبانی بزرگ (LLMs) روز به روز بیشتر برای توصیههای پزشکی مورد استفاده قرار میگیرند، اما آیا واقعاً در حوزه سلامت زنان قابل اعتماد هستند؟
محققان به تازگی بنچمارک جدیدی به نام «WHBench» را معرفی کردهاند که شامل ۴۷ سناریوی تخصصی برای بررسی عملکرد مدلها در موضوعات حساس سلامت زنان است. نتایج این ارزیابی نشان میدهد که حتی بهترین مدلهای فعلی هم در تشخیصهای دقیق و توصیههای ایمن با چالشهای جدی روبرو هستند و هیچکدام نتوانستهاند نمرهای بالاتر از ۷۵ درصد کسب کنند.
این بنچمارک کمک میکند تا ضعفهای مدلها در زمینههایی مثل دستورالعملهای قدیمی، خطاهای دوز دارویی و مسائل مربوط به عدالت در سلامت شناسایی شود تا شاهد مدلهای ایمنتری در آینده باشیم.
منبع: arXiv AI
