تا به امروز عرف بود که مدلهای متخصص را در نقطه بهینهی «تلفات اعتبارسنجی» (Validation Loss) با هم ترکیب کنیم. اما یک تحقیق جدید روی مدلهای Qwen 3.5 نشان داده که این روش همیشه بهترین نتیجه را نمیدهد!
نکات کلیدی این پژوهش:
🔹 روشهای ساده میانگینگیری با «بیشبرازش» (Overfitting) به شدت افت کیفیت پیدا میکنند.
🔹 برخلاف انتظار، روشهای مبتنی بر «تُهیسازی» (Sparsification) حتی پس از عبور از نقطه بهینه آموزش، عملکرد بهتری دارند.
🔹 نتیجهگیری: نباید زمان آموزش و روش ترکیب مدلها را جدا از هم در نظر گرفت؛ این دو فاکتور باید مکمل یکدیگر تنظیم شوند تا خروجی نهایی هوشمندتر باشد.
این یافتهها میتواند مسیر جدیدی را برای توسعهدهندگان مدلهای ترکیبی و متخصصان یادگیری ماشین باز کند. 🚀
منبع: arXiv AI
