محققان در پژوهشی جدید، بنچمارک جذابی به نام «NatureBench» را معرفی کردهاند. این معیار شامل ۹۰ وظیفه علمی است که از مقالات معتبر خانواده Nature استخراج شده تا توانایی واقعی «عوامل کدنویس» (Coding Agents) را در حل مسائل علمی بسنجد.
نتیجه جالب اینجاست: اکثر این مدلها هنوز در «اختراع» علمی ضعیف هستند و بیشتر به روش «ترجمه متدها» عمل میکنند؛ یعنی سعی میکنند مسائل علمی پیچیده را به کارهای سادهتری که قبلاً دیده بودند تبدیل کنند. با این حال، NatureBench گام بزرگی برای ارزیابی دقیقتر هوش مصنوعی در مسیر اکتشافات علمی محسوب میشود.
اطلاعات بیشتر و کد این پروژه را میتوانید در لینک زیر ببینید:
🔗 https://github.com/FrontisAI/NatureBench
منبع: arXiv NLP
