🧠 معرفی بنچ‌مارک جدید ArbiGraph؛ چالش جدی برای هوش مصنوعی در حفظ مسیر استدلال!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا مدل‌های زبانی واقعاً می‌توانند استدلال‌های طولانی و پیچیده را مدیریت کنند؟ محققان با معرفی «ArbiGraph»، ابزاری جدید برای بررسی توانایی مدل‌های هوش مصنوعی (مثل Qwen3.5) در حفظ، به‌روزرسانی و ترکیب اطلاعات در وظایف چندمرحله‌ای ارائه کرده‌اند.

نتایج این تحقیق نشان می‌دهد که مدل‌ها در حل مسائل تک‌مرحله‌ای عالی عمل می‌کنند، اما با پیچیده شدن زنجیره وابستگی‌ها و افزایش طول استدلال، عملکرد آن‌ها تا ۳۳ درصد افت می‌کند! این ابزار به ما کمک می‌کند تا بفهمیم چرا مدل‌های فعلی در وظایف پیچیده منطقی دچار «فراموشی» یا سردرگمی می‌شوند.

این یک گام مهم برای بهبود قابلیت اطمینان ایجنت‌های هوشمند در دنیای واقعی است. 🚀

منبع: arXiv AI