حتماً میدانید که «هرس کردن لایهها» (Layer Pruning) یکی از روشهای محبوب برای سبکتر و سریعتر کردن مدلهای زبانی بزرگ (LLM) است. اما نتایج یک پژوهش جدید نشان میدهد که این کار میتواند به «استدلال زنجیرهای» (Long-chain reasoning) مدل آسیب جدی بزند. 📉
نکته کلیدی اینجاست: حذف حتی یکی-دو لایه باعث فروپاشی توانایی مدل در «استدلال زمان استنتاج» میشود؛ حتی اگر مدل در تستهای دانش عمومی همچنان عالی عمل کند. به عبارت دیگر، با هرس کردن مدل، هوش منطقی آن قربانی سرعت میشود و متأسفانه با آموزشهای تکمیلی (Fine-tuning) هم بهسادگی قابل جبران نیست.
اگر در حال کار روی بهینهسازی مدلهای استدلالی هستید، حتماً قبل از حذف لایهها این مقاله را بررسی کنید! 🧠🔍
سازی
منبع: arXiv AI
