مدلهای زبانی بزرگ امروزی که از معماری MoE (ترکیب متخصصها) استفاده میکنند، با یک چالش فنی بزرگ به نام گلوگاه «AlltoAll dispatch» دستوپنج نرم میکنند. در پژوهشی جدید، ابزار نوآورانهای به نام DODOCO معرفی شده که معماریهای مختلف (از Mamba-2 گرفته تا MHA) را زیر ذرهبین برده است.
نتایج این تحقیق جالب است: برخلاف تصورات قبلی، توزیع بار کاری در این مدلها بیشتر از اینکه به سختافزار یا «استراتژی توزیع متخصصها» بستگی داشته باشد، به ماهیت تصمیمگیری خودِ مدل وابسته است! این یافتهها به توسعهدهندگان کمک میکند تا بفهمند کدام معماریها در دنیای واقعی دادهها، عملکرد پایدارتر و سریعتری دارند.
منبع: arXiv AI
