🚀 بهینه‌سازی خیره‌کننده در اجرای مدل‌های زبانی انتشاری (dLLMs) با سامانه Sangam

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی انتشاری (Diffusion LLMs) به دلیل ماهیت پردازش خود، چالش‌های زیادی برای کش (Cache) کردن دارند که سرعت اجرا را پایین می‌آورد. حالا محققان سیستمی به نام Sangam معرفی کرده‌اند که با استفاده از یک زمان‌بندی هوشمند و «بودجه توکن»، مشکل وقفه‌ها در پردازش را حل می‌کند.

این سیستم با ترکیب استراتژی‌های سرویس‌دهی، تداخل بین مرحله پیش‌پردازش و تولید توکن‌ها را به حداقل رسانده و بهره‌وری مدل‌های dLLM را به‌طور چشمگیری افزایش می‌دهد. قدمی بزرگ برای اجرای روان‌تر مدل‌های هوش مصنوعی در محیط‌های عملیاتی! ⚡️

منبع: arXiv Machine Learning