🚀 معرفی Relay-Bench: محک جدید برای سنجش قدرت استدلال مدل‌های هوش مصنوعی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به‌تازگی بنچمارک جدیدی به نام «Relay-Bench» معرفی کرده‌اند که سطح متفاوتی از چالش را برای مدل‌های زبانی بزرگ (LLM) ایجاد می‌کند. این بنچمارک برخلاف تست‌های سنتی، توانایی مدل‌ها را در حل زنجیره‌ای از مسائل پیچیده و چندمرحله‌ای در حوزه‌های مختلف (از ریاضی و کدنویسی تا تحلیل داده و جستجوی وب) در یک دستور واحد می‌سنجد.

نکته جالب اینجاست که حتی پیشرفته‌ترین مدل‌ها مثل GPT-5.5 (نسخه xHigh) نیز در این تست تنها ۴۳.۳ درصد امتیاز کسب کرده‌اند که نشان می‌دهد هنوز راه زیادی تا «استدلال چنددامنه‌ای» کامل باقی مانده است. این تست برای مدل‌هایی که اجازه استفاده از ابزارهایی مثل کدنویسی و جستجوی وب را دارند، طراحی شده تا ببینیم آیا هوش مصنوعی می‌تواند در دنیای واقعی مثل یک انسان، مسائل ترکیبی را حل کند یا خیر.

منبع: arXiv AI