آیا مدلهای زبانی واقعاً میتوانند استدلالهای طولانی و پیچیده را مدیریت کنند؟ محققان با معرفی «ArbiGraph»، ابزاری جدید برای بررسی توانایی مدلهای هوش مصنوعی (مثل Qwen3.5) در حفظ، بهروزرسانی و ترکیب اطلاعات در وظایف چندمرحلهای ارائه کردهاند.
نتایج این تحقیق نشان میدهد که مدلها در حل مسائل تکمرحلهای عالی عمل میکنند، اما با پیچیده شدن زنجیره وابستگیها و افزایش طول استدلال، عملکرد آنها تا ۳۳ درصد افت میکند! این ابزار به ما کمک میکند تا بفهمیم چرا مدلهای فعلی در وظایف پیچیده منطقی دچار «فراموشی» یا سردرگمی میشوند.
این یک گام مهم برای بهبود قابلیت اطمینان ایجنتهای هوشمند در دنیای واقعی است. 🚀
منبع: arXiv AI
