اگر در حوزه آموزش مدلهای زبانی بزرگ (LLM) فعالیت میکنید، احتمالاً با چالشهای «تقطیر دانش» (Knowledge Distillation) و کندی فرآیند آموزش آشنا هستید.
محققان به تازگی فریمورک جدیدی به نام KDFlow معرفی کردهاند که با یک معماری هوشمندانه و جداگانه، فرآیند آموزش مدلهای دانشآموز (Student) و معلم (Teacher) را بهینهسازی میکند.
این فریمورک با استفاده از SGLang برای استنتاج معلم و FSDP2 برای آموزش دانشآموز، توانسته سرعت آموزش را بین ۱.۴ تا بیش از ۶ برابر افزایش دهد! این یعنی صرفهجویی چشمگیر در زمان و منابع برای توسعهدهندگان.
اگر به دنبال کاهش هزینهها و افزایش سرعت در پروژههای LLM خود هستید، حتماً نگاهی به کدهای متنباز این پروژه در گیتهاب بیندازید.
منبع: arXiv AI
