مدلهای زبانی انتشاری (Diffusion LLMs) به دلیل ماهیت پردازش خود، چالشهای زیادی برای کش (Cache) کردن دارند که سرعت اجرا را پایین میآورد. حالا محققان سیستمی به نام Sangam معرفی کردهاند که با استفاده از یک زمانبندی هوشمند و «بودجه توکن»، مشکل وقفهها در پردازش را حل میکند.
این سیستم با ترکیب استراتژیهای سرویسدهی، تداخل بین مرحله پیشپردازش و تولید توکنها را به حداقل رسانده و بهرهوری مدلهای dLLM را بهطور چشمگیری افزایش میدهد. قدمی بزرگ برای اجرای روانتر مدلهای هوش مصنوعی در محیطهای عملیاتی! ⚡️
منبع: arXiv Machine Learning
