محققان به تازگی مجموعهداده عظیم و فوقالعادهای شامل ۱۵.۶ میلیون مقاله علمی منتشر کردهاند که بخشهای مختلف آنها (مثل مقدمه، روشها، نتایج و بحث) بهصورت خودکار برچسبگذاری شده است.
این دیتاست که بر پایه S2ORC ساخته شده، ابزاری بینظیر برای پژوهشگران حوزه پردازش زبان طبیعی (NLP) است تا بتوانند الگوهای نوشتاری در متون علمی، بهویژه در رشتههای STEM را با دقت بالا تحلیل کنند. نکته جذاب ماجرا اینجاست که برای اعتبارسنجی این دادهها، از ترکیبی از ارزیابیهای انسانی و مدلهای زبانی (LLM) استفاده شده که دقت آن را با توافق بینانسانی برابری میکند. 🚀
اگر در حوزه تحلیل متون علمی یا آموزش مدلهای زبانی فعالیت میکنید، این دیتاست میتواند دریچهای جدید برای تحقیقات شما باشد.
منبع: arXiv NLP
