محققان در مقالهای جدید، سیستم هوشمند «Director» را معرفی کردهاند که به طور خاص برای کاهش تأخیر در اجرای مدلهای Mixture-of-Experts (MoE) طراحی شده است.
این سیستم با استفاده از روشهای پیشبینی آنلاین و جابهجایی پیشدستانه کارشناسها (Experts) در پردازندههای گرافیکی، میتواند تا ۵۵ درصد تأخیر در سرویسدهی مدلهای هوش مصنوعی را کاهش دهد! ویژگی جذاب این روش، جابهجایی تقریباً بدون توقف (Near-zero downtime) در مدلهای توزیعشده است که جهشی بزرگ در بهرهوری عملیاتی محسوب میشود.
این پیشرفت میتواند راه را برای اجرای سریعتر و ارزانتر مدلهای زبانی بزرگ (LLMs) در مقیاسهای صنعتی هموار کند.
های_زبانی
منبع: arXiv AI
