یکی از چالشهای بزرگ در دنیای مدلهای زبانی (LLMs)، کند بودن مدلهای بازگشتی (Autoregressive) است. حالا محققان تکنیک نوآورانهای به نام «Gumbel Distillation» معرفی کردهاند که به مدلهای سریعِ موازی (Parallel) کمک میکند تا یاد بگیرند خروجیهای باکیفیتتری تولید کنند.
این روش با استفاده از تکنیک Gumbel-Max، شکاف عملکرد بین مدلهای موازی و مدلهای قدرتمند اما کندِ معلم را پر میکند. آزمایشها نشان داده که این تکنیک میتواند تا ۳۰ درصد امتیاز MAUVE را بهبود بخشد، که گامی بزرگ برای رسیدن به نسل جدیدی از هوش مصنوعیهای سریع و دقیق است! 🧠✨
منبع: arXiv Machine Learning
