اگر مدلهای زبانی را روی سیستم شخصی خود اجرا میکنید، حتماً با چالش کندی تولید پاسخ مواجه شدهاید. تکنیک «Speculative Decoding» یک راهکار هوشمندانه و رایگان برای افزایش چشمگیر سرعت خروجی مدلهای محلی است که شاید هنوز از آن استفاده نمیکنید.
این روش با پیشبینیِ توکنهای بعدی توسط یک مدل کوچکتر و سریعتر و سپس تایید آنها توسط مدل اصلی (بزرگتر)، تعداد دفعات اجرای سنگین مدل اصلی را کاهش میدهد. نتیجه؟ تجربهای بسیار سریعتر و روانتر در اجرای مدلها روی سختافزار شخصی!
اگر به دنبال بهینهسازی تجربهی خود در اجرای مدلهای Local هستید، حتماً درباره این تکنیک بیشتر مطالعه کنید.
سازی
منبع: Hacker News LLM
