محققان در تازهترین پژوهش خود، با استفاده از «ریاضیات آرایهها» (Mathematics of Arrays)، چهار روش جدید و بسیار بهینه برای اجرای عملیات Attention در مدلهای ترنسفورمر ارائه کردهاند.
این دستاورد فنی که مستقیماً با هسته پردازشی مدلها سر و کار دارد، توانسته است مصرف حافظه (KV-Cache) را به شدت کاهش داده و سرعت استنتاج (Inference) را با استفاده از هستههای GPU بهینه کند. این یعنی گامی بلند برای اجرای سریعتر و ارزانتر مدلهای زبانی بزرگ روی سختافزارهای موجود! ⚡️
این مقاله نشان میدهد که چطور با تغییرات بنیادی در نحوه محاسبات، میتوان بهرهوری مدلهای هوش مصنوعی را در هنگام پاسخدهی به کاربران (Decode) متحول کرد.
منبع: arXiv Machine Learning
