🔍 چالش جدید برای هوش مصنوعی: بنچمارک SciExplore برای ارزیابی کارهای علمی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا هوش مصنوعی واقعاً می‌تواند در تحقیقات علمی جدی نقش‌آفرینی کند؟ 🤔 محققان به تازگی بنچمارک جدیدی به نام «SciExplore» معرفی کرده‌اند تا توانایی مدل‌های زبانی (LLMs) و عامل‌های هوشمند را در انجام کارهای پژوهشی واقعی بسنجند.

این بنچمارک با تمرکز بر بیش از ۱۰ رشته علمی و در ۴ بخش مختلف، از جستجو در دیتابیس‌های علمی گرفته تا ترکیب دانش و استدلال‌های پیچیده، به چالش کشیده می‌شود. نتایج اولیه نشان می‌دهد که اکثر مدل‌های پیشرفته با افزایش پیچیدگی وظایف، دچار افت عملکرد شدید می‌شوند و هنوز با ایده‌آل‌های ما در تحقیقات علمی فاصله دارند. این یعنی راه درازی برای رسیدن به «دانشمند هوشمند مصنوعی» باقی مانده است! 🧠💻

منبع: arXiv AI