محققان به تازگی روشی نوآورانه مبتنی بر MLIR معرفی کردهاند که چالشهای اجرای مدلهای زبانی بزرگ (LLM) روی سختافزارهای تخصصی را هدف قرار داده است.
این روش که با نام «TPU-MLIR» شناخته میشود، با دو لایه انتزاعی متفاوت (TopOp و TpuOp)، پروسه تبدیل مدلهای هوش مصنوعی به کدهای بهینه برای تراشهها را بسیار سریعتر کرده است. همچنین با تقسیم هوشمندانه مراحل پردازش (Prefill و Decode)، این ابزار به مدلها اجازه میدهد با مدیریت بهتر حافظه، عملکردی بسیار روانتر و بهینهتر داشته باشند.
اگر در حوزه توسعه زیرساختهای هوش مصنوعی فعالیت میکنید، بررسی این پروژه روی گیتهاب میتواند برایتان بسیار کاربردی باشد! 🛠️
نویسی
منبع: arXiv NLP
