محققان در مقاله جدیدی، تکنیک نوآورانهای به نام «Byte-Prefix Marginalization» یا به اختصار BPM معرفی کردهاند که تحولی در آموزش مدلهای کوچک از روی مدلهای بزرگ (Distillation) ایجاد میکند.
💡 چرا این موضوع مهم است؟
تا پیش از این، انتقال دانش بین مدلهایی که توکنایزرهای متفاوتی داشتند (Cross-Tokenizer)، اغلب باعث هدر رفتن اطلاعات ارزشمند میشد. متد جدید BPM با نگاشت توزیع احتمال توکنهای معلم به فضای بایت-محور توکنهای دانشآموز، دقت انتقال دانش را به طرز چشمگیری افزایش داده است.
نتایج این تحقیق نشان میدهد که استفاده از BPM در مدلهایی مثل Qwen3 و GLM، عملکرد آنها را در مسائل ریاضی و برنامهنویسی تا ۷ امتیاز بهبود بخشیده که یک گام بزرگ برای ساخت مدلهای سبک و در عین حال هوشمندتر است.
منبع: arXiv AI
