آیا تا به حال فکر کردهاید که ایجنتهای هوش مصنوعی چطور کدنویسی میکنند؟ اکثر بنچمارکهای فعلی فقط خروجی نهایی را چک میکنند، اما ابزار جدید «AgentLens» رویکردی متفاوت دارد!
این بنچمارک به جای بررسی سادهِ «درست یا غلط بودنِ خروجی»، کل مسیر عملکرد ایجنت (از نحوه دنبال کردن دستورات تا نحوه اصلاح خطاها) را زیر ذرهبین میبرد. 🤖💻
چرا AgentLens مهم است؟
✅ ارزیابی کامل پروسه تولید کد (Trajectory Review)
✅ ترکیب هوش مصنوعی با تأییدیه رسمی (Formal Verification)
✅ کمک به توسعهدهندگان برای عیبیابی دقیقتر رفتار مدلها
این پروژه متنباز است و میتوانید همین حالا آن را در گیتهاب بررسی کنید.
🔗 https://github.com/agent-lens/agent-lens-bench
منبع: arXiv Machine Learning
