با افزایش استفاده از ایجنتهای خودمختار، چالش امنیت و عملکرد صحیح آنها بیش از همیشه حس میشود. محققان به تازگی بنچمارک جدیدی به نام «GuardianAgentBench» را معرفی کردهاند که ۵۸۰ سناریو مختلف را در فریمورکهای معروفی مثل LangChain و LlamaIndex تست میکند.
نتایج این بررسی نشان میدهد که حتی قدرتمندترین مدلها هم در مدیریت ابزارها و برنامهریزیهای طولانیمدت دچار لغزش میشوند. اما خبر خوب این است که پیادهسازی «گاردریل» (Guardrails) توانسته نرخ خطا را به شکل چشمگیری کاهش دهد. این تحقیق گام بزرگی برای رسیدن به ایجنتهای امنتر و دقیقتر در دنیای واقعی است. 🤖✨
منبع: arXiv AI
