ارزیابی توانمندی «ایجنتهای هوشمند» همیشه با چالشهای پراکندگی دادهها و استانداردهای مختلف روبهرو بوده است. حالا محققان با معرفی پروژه بزرگ «Messier»، یک بانک اطلاعاتی عظیم شامل نزدیک به یک میلیون رکورد از ۳۰ بنچمارک مختلف ایجاد کردهاند تا بتوان عملکرد ایجنتها را دقیقتر و استانداردتر سنجید.
نکته جالب اینجاست که این تحقیق نشان میدهد در حالی که مهارتهای برنامهنویسی ایجنتها به سرعت در حال رشد است، وظایف مربوط به «گردشکارهای سازمانی» همچنان بزرگترین چالش برای هوش مصنوعی باقی ماندهاند. این زیرساخت جدید میتواند به معیار جهانی برای سنجش هوشمندی مدلها در آینده تبدیل شود.
منبع: arXiv AI
