اگر در حوزه برنامهنویسی و بهینهسازی هوش مصنوعی فعالیت میکنید، حتماً میدانید که نوشتن هستههای (Kernel) بهینه برای شتابدهندهها چقدر چالشبرانگیز است. محققان به تازگی چارچوب جدیدی معرفی کردهاند که به جای اتکا به حدس و گمان، با تحلیل عمیق و لایهبندی شده (Compiler-Grounded)، هستههای Triton را برای تراشههای NPU به شدت بهینه میکند.
این سیستم با تحلیل رفتار کامپایلر و ساختار IR، پیشنهادهای هوشمندانهای برای بازنویسی کد ارائه میدهد که در تستها تا ۴ برابر افزایش سرعت را به ثبت رسانده است! گامی مهم برای افزایش کارایی زیرساختهای سختافزاری هوش مصنوعی. 🛠️💻
نویسی سازی افزار
منبع: arXiv AI
