اگر در دنیای مدلهای زبانی (LLM) فعال هستید، حتماً میدانید که «کندی در زمان پاسخدهی» یکی از بزرگترین چالشهاست. تکنیک Speculative Decoding تا امروز بهترین راهکار برای افزایش سرعت بوده، اما محققان در یک مقاله جدید، پا را فراتر گذاشتهاند.
مدل جدیدی به نام «SpecVocab» معرفی شده که با انتخاب هوشمندانه زیرمجموعهای از واژگان در هر مرحله از رمزگشایی (Decoding)، توانسته از متدهای پیشرو مثل EAGLE-3 پیشی بگیرد. این روش نهتنها کیفیت خروجی را حفظ میکند، بلکه باعث افزایش ۸.۱ درصدی در نرخ پردازش (Throughput) میشود.
این یعنی هوش مصنوعی در آیندهای نزدیک، سریعتر و بهینهتر از همیشه در اختیار ما خواهد بود! ⚡️
نویسی
منبع: arXiv NLP
