محققان به تازگی ابزار جدیدی به نام RWGBench را معرفی کردهاند که به طور خاص برای سنجش توانایی مدلهای زبانی بزرگ در نوشتن بخش «کارهای مرتبط» (Related Work) در مقالات علمی طراحی شده است.
مشکل اینجاست که معیارهای فعلی، فقط شباهت متنی را میسنجند، اما RWGBench تمرکز خود را بر «نحوه انتخاب منابع»، «ساختار علمی» و «دقت ارجاعدهی» گذاشته است. این یک قدم بزرگ برای اطمینان از صحت علمی متونی است که توسط هوش مصنوعی تولید میشوند.
اگر در زمینه تولید متنهای علمی با AI کار میکنید، این بنچمارک میتواند دید بهتری از ضعفها و قدرت مدلها به شما بدهد.
منبع: arXiv AI
