🔍 کد زدن با هوش مصنوعی؛ چگونه از “شک” مدل‌ها باخبر شویم؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از بزرگترین چالش‌های استفاده از مدل‌های زبانی (LLM) در برنامه‌نویسی، این است که مدل‌ها گاهی اوقات با اعتماد به نفسِ کاذب، کدهای غلط تولید می‌کنند. حالا محققان فریم‌ورک جدیدی به نام Code-MUE معرفی کرده‌اند که این مشکل را حل می‌کند!

این ابزار به جای تمرکز بر ظاهر متن، کدهای تولید شده را در فضای اجرایی تست می‌کند تا بفهمد مدل چقدر نسبت به پاسخ خود اطمینان دارد. در واقع، این فریم‌ورک با بررسی رفتار کدهای تولید شده در زمان اجرا (Runtime)، متوجه می‌شود که آیا مدل واقعاً راه حل را بلد است یا فقط در حال حدس زدن است.

این روش که بر پایه “گراف‌های تعاملی معنایی” کار می‌کند، دقت بسیار بالایی در شناسایی کدهای ناامن یا اشتباه دارد و می‌تواند تحول مهمی در ابزارهای کمک‌برنامه‌نویسی و امنیت نرم‌افزار ایجاد کند. 💻🚀

‌نویسی

منبع: arXiv AI