محققان در یک پژوهش جدید، به چالشی جدی در دنیای مدلهای زبانی بزرگ (LLM) پرداختهاند: «ضعف در دنبال کردن دستورالعملهای پیچیده منطقی».
با وجود پیشرفتهای چشمگیر، مدلهای فعلی هنوز در درک مفاهیمی مثل حلقهها، شرایط شرطی پیچیده و فراخوانی توابع که در کدنویسی حیاتی هستند، دچار مشکل هستند. این تیم با معرفی دو ابزار جدید:
🔹 LogicIFGen: چارچوبی خودکار برای تولید دستورالعملهای منطقی قابل تایید.
🔹 LogicIFEval: بنچمارکی شامل ۴۲۶ دستورالعمل منطقی دشوار.
نتایج آزمایشها نشان میدهد حتی پیشرفتهترین مدلهای هوش مصنوعی فعلی هم موفق به پاسخگویی صحیح به بیش از ۶۰ درصد این دستورالعملها نمیشوند. این یعنی هنوز مسیر زیادی برای رسیدن به هوش مصنوعی واقعاً منطقی در پیش داریم! 🧠✨
🔗 دسترسی به کد و بنچمارک در گیتهاب
نویسی های_زبانی
منبع: arXiv Machine Learning
