اگر در حال توسعه ایجنتهای هوش مصنوعی هستید، حتما میدانید که سنجش خروجیها چقدر چالشبرانگیز است. ابزار جدید و متنباز «Verdict» به تازگی منتشر شده که به شما کمک میکند خروجیهای ایجنتهای خود را به راحتی ارزیابی کنید.
این ابزار از ترکیب قضاوتهای انسانی و داورهای مبتنی بر LLM استفاده میکند تا کیفیت خروجیها را به دقت بسنجد. اگر به دنبال بهینهسازی مدلها و ایجنتهای خود هستید، این پروژه سبک و کاربردی را در گیتهاب بررسی کنید.
🔗 لینک پروژه: https://github.com/AntoineF23/verdict
نویسی
منبع: Hacker News AI
