🔍 توهمِ درستی؛ چرا مدل‌های هوش مصنوعی در کدنویسی GPU گاهی به خطا می‌روند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا کدهای GPU که توسط هوش مصنوعی تولید می‌شوند واقعاً بی‌نقص هستند؟ محققان در مطالعه جدید خود متوجه شدند که بسیاری از بنچمارک‌های فعلی (مثل KernelBench) به دلیل استفاده از تست‌های سطحی، بسیاری از باگ‌های ظریف در تولید «کرنل‌های GPU» را نادیده می‌گیرند.

در این پژوهش با استفاده از روش «فازینگ آگاه از اسکیما» (Schema-aware Fuzzing)، مشخص شد که بسیاری از کدهای تولید شده توسط مدل‌های زبانی، با وجود عبور از تست‌های استاندارد، در شرایط عملیاتی دچار «توهمِ درستی» هستند. این یعنی هوش مصنوعی ممکن است کدی بنویسد که در ظاهر درست کار می‌کند اما در واقعیت حاوی خطاهای منطقی است که در بنچمارک‌های ساده شناسایی نمی‌شوند. 💻⚠️

این یافته یک زنگ خطر مهم برای توسعه‌دهندگانی است که در پروژه‌های سنگین محاسباتی به کدنویسیِ خودکارِ LLMها اعتماد می‌کنند.

‌نویسی ‌افزار

منبع: arXiv Machine Learning