محققان در تازهترین دستاورد خود، فریمورک «AdaFlash» را برای بهینهسازی استنتاج (Inference) مدلهای زبانی بزرگ معرفی کردهاند. این روش با حل چالشهای «درافترهای نفوذی» (Diffusion Drafters) در تکنیک Speculative Decoding، باعث میشود مدلها بسیار سریعتر و با پایداری بیشتری عمل کنند.
تکنیک AdaFlash دو قابلیت کلیدی دارد:
۱. کاهش نوسانات و خطاهای تولید متن با الگوریتم تقطیر سیاستمحور (OPD).
۲. تنظیم هوشمند طول توالی خروجی به صورت لحظهای که هزینههای پردازشی را به شدت کاهش میدهد.
این یعنی در آینده نزدیک، پاسخدهی چتباتها و مدلهای هوش مصنوعی حتی از امروز هم سریعتر خواهد بود! ⚡️
منبع: arXiv Machine Learning
