اگر در دنیای LLMها فعالیت میکنید، حتماً با چالش «کندی تولید متن» و گلوگاههای زمان تأخیر (Latency) آشنا هستید. محققان به تازگی معماری جدیدی به نام «SPD» معرفی کردهاند که با استفاده از «پاراللسازی خطلولهای»، استنتاج مدل را به مراتب سریعتر از روشهای فعلی (مثل EAGLE-3) کرده است.
نکته کلیدی اینجاست: به جای روشهای سنتیِ پیشبینی چندتوکنی که باعث افزایش خطا میشدند، SPD با تقسیم مدل به مراحل مختلف و استفاده از یک ماژول کمکی (PDM)، همزمان چندین توکن را پردازش میکند. نتیجه؟ کاهش چشمگیر تأخیر و افزایش دقت همزمان! 🧠⚡
این نوآوری میتواند گام بزرگی برای اجرای روانتر مدلهای سنگین روی سختافزارهای مختلف باشد.
لینک پروژه: https://github.com/yuyijiong/speculative_pipeline_decoding
منبع: arXiv NLP
