آیا کدهای GPU که توسط هوش مصنوعی تولید میشوند واقعاً بینقص هستند؟ محققان در مطالعه جدید خود متوجه شدند که بسیاری از بنچمارکهای فعلی (مثل KernelBench) به دلیل استفاده از تستهای سطحی، بسیاری از باگهای ظریف در تولید «کرنلهای GPU» را نادیده میگیرند.
در این پژوهش با استفاده از روش «فازینگ آگاه از اسکیما» (Schema-aware Fuzzing)، مشخص شد که بسیاری از کدهای تولید شده توسط مدلهای زبانی، با وجود عبور از تستهای استاندارد، در شرایط عملیاتی دچار «توهمِ درستی» هستند. این یعنی هوش مصنوعی ممکن است کدی بنویسد که در ظاهر درست کار میکند اما در واقعیت حاوی خطاهای منطقی است که در بنچمارکهای ساده شناسایی نمیشوند. 💻⚠️
این یافته یک زنگ خطر مهم برای توسعهدهندگانی است که در پروژههای سنگین محاسباتی به کدنویسیِ خودکارِ LLMها اعتماد میکنند.
نویسی افزار
منبع: arXiv Machine Learning
