تا به حال برایتان پیش آمده که یک ایجنت هوش مصنوعی در ویدئوهای نمایشی عالی کار کند، اما در دنیای واقعی و تستهای دقیق، ضعیف ظاهر شود؟
این مخزن جدید در گیتهاب (skills) رویکردی متفاوت دارد؛ تمرکز اصلی به جای دموهای نمایشی، روی «ارزیابیهای دقیق» (Evals) است. این یعنی میتوانید توانایی واقعی عاملهای هوشمند را در انجام تسکهای مختلف بسنجید و خروجیهای واقعی آنها را با استانداردهای سختگیرانه مقایسه کنید.
اگر در حال توسعه ایجنت هستید، بررسی این مجموعه میتواند دید بهتری برای بهبود عملکرد مدلهایتان به شما بدهد.
🔗 لینک مخزن: https://github.com/sourishkrout/skills
نویسی
منبع: Hacker News AI