اگر در دنیای هوش مصنوعی فعالیت میکنید، حتماً میدانید که یکی از بزرگترین چالشهای اجرای مدلهای عظیم (LLM)، مصرف بالای منابع محاسباتی و زمان صرف شده برای پردازشهای لایه MLP است.
محققان در یک دستاورد فنی جدید، هستههای (Kernels) مبتنی بر CUTLASS را طراحی کردهاند که عملیات SwiGLU را در سطح کاشی (Tile) با عملیات ماتریسی (GeMM) ادغام میکند. این نوآوری نتایج شگفتانگیزی داشته است:
⚡️ افزایش سرعت تا ۲.۴۷ برابر در مقایسه با PyTorch.
🎯 بهبود دقت محاسباتی و کاهش خطاهای عددی نسبت به کتابخانههای استاندارد cuBLAS.
⚙️ انتقال گلوگاه از حافظه به محاسبات و رسیدن به بهرهوری خیرهکننده ۷۹.۵ درصدی در تراشههای H100 انویدیا.
این تحقیق ثابت میکند که هنوز هم طراحیهای دستی و بهینه در سطح پایین (Low-level)، بسیار قدرتمندتر از کامپایلرهای خودکار عمل میکنند. یک گام بزرگ دیگر برای اجرای سریعتر و ارزانتر مدلهای هوشمند در دنیای واقعی!
منبع: arXiv Machine Learning
