مدلهای Mixture-of-Experts (MoE) همیشه به عنوان راهکاری برای اجرای سریع و کمهزینه روی سختافزارهای ضعیفتر شناخته میشوند؛ چون در هر مرحله فقط بخش کوچکی از شبکه فعال میشود.
اما یک مطالعه جدید و جالب، این ادعا را در دنیای واقعی به چالش کشیده! نتایج بنچمارک روی Apple M2 و NVIDIA Jetson نشان میدهد که در سختافزارهای محدود (Edge)، مدلهای MoE لزوماً سریعتر از مدلهای متراکم (Dense) عمل نمیکنند. دلیل آن هم محدودیت پهنای باند و حجم حافظه کل مدل است، نه فقط تعداد پارامترهای فعال. در واقع، اینجا «اندازه کل» مدل است که حرف اول را میزند!
نکته مهم برای توسعهدهندگان: اگر قصد دارید مدلهای هوش مصنوعی را روی دیوایسهای محلی و ضعیف اجرا کنید، شاید مدلهای متراکم کوچکتر، انتخاب بهینهتری نسبت به MoE باشند.
منبع: arXiv AI
