یکی از بزرگترین چالشهای استفاده از مدلهای زبانی (LLM) در برنامهنویسی، این است که مدلها گاهی اوقات با اعتماد به نفسِ کاذب، کدهای غلط تولید میکنند. حالا محققان فریمورک جدیدی به نام Code-MUE معرفی کردهاند که این مشکل را حل میکند!
این ابزار به جای تمرکز بر ظاهر متن، کدهای تولید شده را در فضای اجرایی تست میکند تا بفهمد مدل چقدر نسبت به پاسخ خود اطمینان دارد. در واقع، این فریمورک با بررسی رفتار کدهای تولید شده در زمان اجرا (Runtime)، متوجه میشود که آیا مدل واقعاً راه حل را بلد است یا فقط در حال حدس زدن است.
این روش که بر پایه “گرافهای تعاملی معنایی” کار میکند، دقت بسیار بالایی در شناسایی کدهای ناامن یا اشتباه دارد و میتواند تحول مهمی در ابزارهای کمکبرنامهنویسی و امنیت نرمافزار ایجاد کند. 💻🚀
نویسی
منبع: arXiv AI
