🚀 پشت‌پرده کندی در مدل‌های MoE؛ چرا هوش مصنوعی گاهی «گیر» می‌کند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی بزرگ امروزی که از معماری MoE (ترکیب متخصص‌ها) استفاده می‌کنند، با یک چالش فنی بزرگ به نام گلوگاه «AlltoAll dispatch» دست‌وپنج نرم می‌کنند. در پژوهشی جدید، ابزار نوآورانه‌ای به نام DODOCO معرفی شده که معماری‌های مختلف (از Mamba-2 گرفته تا MHA) را زیر ذره‌بین برده است.

نتایج این تحقیق جالب است: برخلاف تصورات قبلی، توزیع بار کاری در این مدل‌ها بیشتر از اینکه به سخت‌افزار یا «استراتژی توزیع متخصص‌ها» بستگی داشته باشد، به ماهیت تصمیم‌گیری خودِ مدل وابسته است! این یافته‌ها به توسعه‌دهندگان کمک می‌کند تا بفهمند کدام معماری‌ها در دنیای واقعی داده‌ها، عملکرد پایدارتر و سریع‌تری دارند.

منبع: arXiv AI