مدلهای هوش مصنوعی روزبهروز از یک چتبات ساده به «ایجنتهای عمومی» تبدیل میشوند که میتوانند ابزارهای مختلف را به کار بگیرند و کارهای پیچیده انجام دهند. اما مشکل اینجاست که بنچمارکهای فعلی برای تست این توانمندیها چندان جامع نیستند.
محققان برای حل این چالش، «OmniaBench» را معرفی کردهاند؛ یک بنچمارک عظیم شامل بیش از ۱۴۰۰ تسک متنوع در حوزههای مختلف (از کسبوکار تا حوزههای فنی) که برای سنجش دقیق دقت، استدلال و مهارت ایجنتهای هوشمند در دنیای واقعی طراحی شده است.
این بنچمارک جدید حتی مدلهای قدرتمندی مثل GPT-5.6 و Claude-Sonnet-5 را هم به چالش کشیده و نشان میدهد که هنوز راه زیادی تا کمال مطلق در دنیای ایجنتهای هوشمند باقی مانده است. مسیر هوش مصنوعی به سمت خودمختاری کامل هر روز هیجانانگیزتر میشود! 🔥
منبع: arXiv NLP
