یکی از چالشهای اصلی در کار با ایجنتهای مبتنی بر مدلهای زبانی (LLM)، این است که آیا این مدلها واقعاً مهارتهای تعریفشده را یاد گرفتهاند یا فقط بهطور تصادفی به نتیجه رسیدهاند؟
محققان در پژوهش جدید خود، متریک نوآورانهای به نام «Skill Coverage» را معرفی کردهاند که مانند یک سیستم تست دقیق، بررسی میکند که ایجنتها چقدر از دستورالعملهای مهارتمحور را در عمل پیادهسازی کردهاند. نتایج آزمایشها روی بنچمارک SkillsBench نشان داد که ایجنتهای فعلی هنوز تا پوشش کامل رفتارهای مورد انتظار فاصله زیادی دارند.
این ابزار کمک میکند تا نقاط ضعف ایجنتها مشخص شود و با تقویت دستورالعملها، عملکرد آنها در دنیای واقعی به شکل چشمگیری بهبود یابد. قدمی دیگر برای رسیدن به ایجنتهای هوشمندتر و قابلاعتمادتر!
منبع: arXiv AI
