آیا هوش مصنوعی واقعاً میتواند در تحقیقات علمی جدی نقشآفرینی کند؟ 🤔 محققان به تازگی بنچمارک جدیدی به نام «SciExplore» معرفی کردهاند تا توانایی مدلهای زبانی (LLMs) و عاملهای هوشمند را در انجام کارهای پژوهشی واقعی بسنجند.
این بنچمارک با تمرکز بر بیش از ۱۰ رشته علمی و در ۴ بخش مختلف، از جستجو در دیتابیسهای علمی گرفته تا ترکیب دانش و استدلالهای پیچیده، به چالش کشیده میشود. نتایج اولیه نشان میدهد که اکثر مدلهای پیشرفته با افزایش پیچیدگی وظایف، دچار افت عملکرد شدید میشوند و هنوز با ایدهآلهای ما در تحقیقات علمی فاصله دارند. این یعنی راه درازی برای رسیدن به «دانشمند هوشمند مصنوعی» باقی مانده است! 🧠💻
منبع: arXiv AI
