اگر در حوزه توسعه نرمافزار و هوش مصنوعی فعالیت میکنید، حتما میدانید که ترجمه کدهای موازی (مثل CUDA یا OpenMP) چقدر پیچیده است. مدلهای زبانی فعلی اغلب در حفظ منطق دقیق این کدها دچار مشکل میشوند.
محققان بهتازگی بنچمارک جدیدی به نام «ParBench» را معرفی کردهاند که به طور تخصصی برای سنجش توانایی LLMها در ترجمه دقیق کدهای پردازش موازی طراحی شده است. این ابزار به جای تمرکز بر ظاهر کد، مستقیماً «رفتار» و «عملکرد» واقعی برنامهها را بررسی میکند تا بفهمد آیا مدلها واقعاً برنامهنویسی موازی را درک کردهاند یا فقط حفظ کردهاند! 🚀
این یک قدم بزرگ برای رسیدن به کدنویسهای هوشمند و قابلاعتمادتر در حوزههای محاسبات سنگین (HPC) است.
منبع: arXiv AI
