مدلهای زبانی مبتنی بر دیفیوژن (DLLMs) پتانسیل زیادی برای تولید سریع متن دارند، اما معمولاً کاهش مراحل تولید (Decoding steps) باعث افت کیفیت خروجی میشد. حالا محققان با معرفی متد جدید «خود-تقطیری» (Self-Distillation) راهکار جذابی پیدا کردهاند.
این روش با آموزش یک مدل دانشجو (Student) که مسیر تولید مدل اصلی را دنبال میکند، مشکل خطاهای پردازشی را تا حد زیادی حل کرده و با استفاده از بهینهسازی DDO، در کارهای منطقی و تولید کد هم نتایج درخشانی نشان داده است. این یعنی خروجیهای باکیفیت با سرعت بسیار بالاتر! ⚡️
منبع: arXiv Machine Learning
