محققان در پژوهش جدیدی، عملکرد مدلهای زبانی مانند BiomedBERT را در برابر متخصصان انسانی برای دستهبندی مقالات پزشکی (با استفاده از دادههای MeSH) به چالش کشیدند. 🧬
این مطالعه نشان میدهد که «نحوه طراحی ارزیابی» چقدر بر خروجی مدلهای هوش مصنوعی تأثیرگذار است. در واقع، بسیاری از تفاوتهای عملکردی گزارش شده میان هوش مصنوعی و انسان، نه به قدرت مدل، بلکه به متدولوژیِ تست کردن برمیگردد. این یافته، درک ما از دقت مدلهای هوش مصنوعی در محیطهای تخصصی پزشکی را یک پله ارتقا میدهد. 💡
منبع: arXiv NLP
