🚀 سرعت خیره‌کننده در اجرای مدل‌های زبانی بزرگ با بهینه‌سازی جدید!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

اگر در دنیای هوش مصنوعی فعالیت می‌کنید، حتماً می‌دانید که یکی از بزرگترین چالش‌های اجرای مدل‌های عظیم (LLM)، مصرف بالای منابع محاسباتی و زمان صرف شده برای پردازش‌های لایه MLP است.

محققان در یک دستاورد فنی جدید، هسته‌های (Kernels) مبتنی بر CUTLASS را طراحی کرده‌اند که عملیات SwiGLU را در سطح کاشی (Tile) با عملیات ماتریسی (GeMM) ادغام می‌کند. این نوآوری نتایج شگفت‌انگیزی داشته است:

⚡️ افزایش سرعت تا ۲.۴۷ برابر در مقایسه با PyTorch.
🎯 بهبود دقت محاسباتی و کاهش خطاهای عددی نسبت به کتابخانه‌های استاندارد cuBLAS.
⚙️ انتقال گلوگاه از حافظه به محاسبات و رسیدن به بهره‌وری خیره‌کننده ۷۹.۵ درصدی در تراشه‌های H100 انویدیا.

این تحقیق ثابت می‌کند که هنوز هم طراحی‌های دستی و بهینه در سطح پایین (Low-level)، بسیار قدرتمندتر از کامپایلرهای خودکار عمل می‌کنند. یک گام بزرگ دیگر برای اجرای سریع‌تر و ارزان‌تر مدل‌های هوشمند در دنیای واقعی!

منبع: arXiv Machine Learning