محققان در مقالهای جدید، روشی نوآورانه برای آموزش مدلهای زبانی بزرگ معرفی کردهاند. در این تکنیک که با عنوان «Multi-Task On-Policy Distillation» شناخته میشود، مدل دانشآموز میتواند چندین مهارت مختلف (مانند ریاضی، علوم و ابزارها) را به صورت موازی از چندین «معلم مجازی» بیاموزد، بدون اینکه دچار فراموشی یا افت عملکرد در دانش قبلی خود شود.
این روش که با استفاده از «سافت-پراپتها» (Soft-Prompts) پیادهسازی شده، بسیار بهینهتر از روشهای سنتیِ تنظیم دقیق (Fine-tuning) است و اجازه میدهد مدلها با صرف منابع کمتر، هوشمندتر شوند. این دستاورد میتواند گامی بزرگ برای رسیدن به مدلهای شخصیسازیشده و همهفنحریف باشد!
منبع: arXiv Machine Learning
