🎯 ارتقای هوش مصنوعی در اجرای دستورات پیچیده؛ معرفی بنچمارک ComplexConstraints

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های بزرگ مدل‌های زبانی، ناتوانی در رعایت دقیق دستورالعمل‌های چندلایه و پیچیده است. محققان به تازگی برای حل این مشکل، بنچمارک جدیدی به نام ComplexConstraints را معرفی کرده‌اند که فراتر از تست‌های ساده، قدرت «استدلال منطقی» و «پیروی از دستورات» ایجنت‌های هوش مصنوعی را به دقت ارزیابی می‌کند.

این تحقیق نشان می‌دهد که با استفاده از سیستم‌های پاداشِ مبتنی بر «روبریِ تخصصی» (Expert Rubrics)، می‌توان مدل‌های کوچک‌تر (مثل یک مدل ۴ میلیاردی) را طوری آموزش داد که در اجرای وظایف پیچیده، عملکردی در سطح مدل‌های بسیار بزرگ‌تر داشته باشند. این پیشرفت می‌تواند گامی مهم برای هوشمندتر شدن ایجنت‌هایی باشد که در محیط‌های کاری واقعی به کار گرفته می‌شوند.

منبع: arXiv AI