🔍 معرفی AgentLens: تحولی در ارزیابی ایجنت‌های برنامه‌نویس

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال فکر کرده‌اید که ایجنت‌های هوش مصنوعی چطور کدنویسی می‌کنند؟ اکثر بنچمارک‌های فعلی فقط خروجی نهایی را چک می‌کنند، اما ابزار جدید «AgentLens» رویکردی متفاوت دارد!

این بنچمارک به جای بررسی سادهِ «درست یا غلط بودنِ خروجی»، کل مسیر عملکرد ایجنت (از نحوه دنبال کردن دستورات تا نحوه اصلاح خطاها) را زیر ذره‌بین می‌برد. 🤖💻

چرا AgentLens مهم است؟
✅ ارزیابی کامل پروسه تولید کد (Trajectory Review)
✅ ترکیب هوش مصنوعی با تأییدیه رسمی (Formal Verification)
✅ کمک به توسعه‌دهندگان برای عیب‌یابی دقیق‌تر رفتار مدل‌ها

این پروژه متن‌باز است و می‌توانید همین حالا آن را در گیت‌هاب بررسی کنید.

🔗 https://github.com/agent-lens/agent-lens-bench

منبع: arXiv Machine Learning