محققان در مقاله جدیدی، چارچوب نوآورانه STAIF را معرفی کردهاند که مشکل بزرگ مدلهای زبانی در رعایت همزمان چندین محدودیت (Constraints) در دستورات پیچیده را حل میکند.
نکته کلیدی این روش، رویکرد دومرحلهای آن است:
✅ مرحله اول: استفاده از بهینهسازی ترجیحی برای درک بهتر دستورات نرم (Subjective).
✅ مرحله دوم: بهکارگیری یادگیری تقویتی با پاداشهای قابلتایید (RLVR) برای اطمینان از رعایت دقیق و سختگیرانه محدودیتهای فنی.
آنها همچنین مجموعه داده جدیدی به نام STAINSTRUCT شامل ۳۱ هزار دستورالعمل پیچیده دوزبانه (انگلیسی-چینی) منتشر کردهاند که عملکرد مدلها را در بنچمارکهای مختلف به شدت بهبود میبخشد. این یعنی مدلهای هوش مصنوعی آینده در اجرای دستورات چندمرحلهای و دقیق، بسیار هوشمندتر خواهند بود! 🚀
منبع: arXiv NLP
