آیا تا به حال فکر کردهاید که چرا برخی ایجنتهای هوش مصنوعی در حل مسائل کدنویسی شکست میخورند؟ محققان در مقالهای تازه، چارچوب جدیدی معرفی کردهاند که میتواند عملکرد ایجنتها را در بنچمارکهای مختلف پیشبینی کند.
این روش که از «نظریه پاسخ به سوال» (IRT) الهام گرفته، به جای اتکا به عددهای کلی و مبهم، تواناییهای یک مدل زبانی و ابزارهای پشتیبان (Scaffold) آن را به صورت جداگانه تحلیل میکند. این دستاورد برای توسعهدهندگان بسیار کاربردی است، چون بدون نیاز به اجرای تستهای پرهزینه، میتوانند بفهمند کدام ایجنت برای چه تسک پیچیدهای مناسبتر است.
دنیای ایجنتهای خودمختار هر روز دقیقتر و هوشمندتر میشود! 🛠️💻
نویسی
منبع: arXiv AI
