🔬 آیا هوش مصنوعی می‌تواند در حد دانشمندان Nature مقاله علمی بنویسد؟ 🤖

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید، بنچمارک جذابی به نام «NatureBench» را معرفی کرده‌اند. این معیار شامل ۹۰ وظیفه علمی است که از مقالات معتبر خانواده Nature استخراج شده تا توانایی واقعی «عوامل کدنویس» (Coding Agents) را در حل مسائل علمی بسنجد.

نتیجه جالب اینجاست: اکثر این مدل‌ها هنوز در «اختراع» علمی ضعیف هستند و بیشتر به روش «ترجمه متدها» عمل می‌کنند؛ یعنی سعی می‌کنند مسائل علمی پیچیده را به کارهای ساده‌تری که قبلاً دیده بودند تبدیل کنند. با این حال، NatureBench گام بزرگی برای ارزیابی دقیق‌تر هوش مصنوعی در مسیر اکتشافات علمی محسوب می‌شود.

اطلاعات بیشتر و کد این پروژه را می‌توانید در لینک زیر ببینید:
🔗 https://github.com/FrontisAI/NatureBench

منبع: arXiv NLP