یکی از چالشهای بزرگ مدلهای زبانی، ناتوانی در رعایت دقیق دستورالعملهای چندلایه و پیچیده است. محققان به تازگی برای حل این مشکل، بنچمارک جدیدی به نام ComplexConstraints را معرفی کردهاند که فراتر از تستهای ساده، قدرت «استدلال منطقی» و «پیروی از دستورات» ایجنتهای هوش مصنوعی را به دقت ارزیابی میکند.
این تحقیق نشان میدهد که با استفاده از سیستمهای پاداشِ مبتنی بر «روبریِ تخصصی» (Expert Rubrics)، میتوان مدلهای کوچکتر (مثل یک مدل ۴ میلیاردی) را طوری آموزش داد که در اجرای وظایف پیچیده، عملکردی در سطح مدلهای بسیار بزرگتر داشته باشند. این پیشرفت میتواند گامی مهم برای هوشمندتر شدن ایجنتهایی باشد که در محیطهای کاری واقعی به کار گرفته میشوند.
منبع: arXiv AI
