حتماً میدانید که ایجنتهای هوش مصنوعی (AI Agents) قرار است با ابزارهای مختلف کار کنند، اما جالب است بدانید که اکثر مدلهای فعلی، حتی مدلهای بزرگ و قدرتمند، در استفاده «دقیق» از ابزارها دچار چالش هستند.
محققان بهتازگی بنچمارک جدیدی به نام ToolFailBench را معرفی کردهاند که به طور خاص بررسی میکند یک مدل کجا در استفاده از ابزار شکست میخورد: آیا ابزار را نادیده میگیرد؟ آیا خروجی را غلط تفسیر میکند؟ یا بیدلیل از ابزار استفاده میکند؟
نتایج این تحقیق نشان میدهد که حتی پیشرفتهترین مدلها هنوز در استفاده صادقانه و دقیق از ابزارها به کمال نرسیدهاند و تفاوت عملکرد مدلهایی مثل Llama 3.1 و Qwen 2.5 در این زمینه بسیار معنادار است. این بنچمارک کمک میکند تا بفهمیم مدلها دقیقاً در کدام مرحله از تعامل با ابزارها دچار خطای منطقی میشوند.
این تحقیق گامی مهم برای ساخت ایجنتهای هوشمندتر و قابلاعتمادتر در دنیای واقعی است. 🤖⚙️
منبع: arXiv AI
