محققان بهتازگی بنچمارک جدیدی به نام «Relay-Bench» معرفی کردهاند که سطح متفاوتی از چالش را برای مدلهای زبانی بزرگ (LLM) ایجاد میکند. این بنچمارک برخلاف تستهای سنتی، توانایی مدلها را در حل زنجیرهای از مسائل پیچیده و چندمرحلهای در حوزههای مختلف (از ریاضی و کدنویسی تا تحلیل داده و جستجوی وب) در یک دستور واحد میسنجد.
نکته جالب اینجاست که حتی پیشرفتهترین مدلها مثل GPT-5.5 (نسخه xHigh) نیز در این تست تنها ۴۳.۳ درصد امتیاز کسب کردهاند که نشان میدهد هنوز راه زیادی تا «استدلال چنددامنهای» کامل باقی مانده است. این تست برای مدلهایی که اجازه استفاده از ابزارهایی مثل کدنویسی و جستجوی وب را دارند، طراحی شده تا ببینیم آیا هوش مصنوعی میتواند در دنیای واقعی مثل یک انسان، مسائل ترکیبی را حل کند یا خیر.
منبع: arXiv AI
