⚠️ هشدار به بهینه‌سازان مدل‌های زبانی: فریب کاهش لایه‌ها را نخورید!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

حتماً می‌دانید که «هرس کردن لایه‌ها» (Layer Pruning) یکی از روش‌های محبوب برای سبک‌تر و سریع‌تر کردن مدل‌های زبانی بزرگ (LLM) است. اما نتایج یک پژوهش جدید نشان می‌دهد که این کار می‌تواند به «استدلال زنجیره‌ای» (Long-chain reasoning) مدل آسیب جدی بزند. 📉

نکته کلیدی اینجاست: حذف حتی یکی-دو لایه باعث فروپاشی توانایی مدل در «استدلال زمان استنتاج» می‌شود؛ حتی اگر مدل در تست‌های دانش عمومی همچنان عالی عمل کند. به عبارت دیگر، با هرس کردن مدل، هوش منطقی آن قربانی سرعت می‌شود و متأسفانه با آموزش‌های تکمیلی (Fine-tuning) هم به‌سادگی قابل جبران نیست.

اگر در حال کار روی بهینه‌سازی مدل‌های استدلالی هستید، حتماً قبل از حذف لایه‌ها این مقاله را بررسی کنید! 🧠🔍

‌سازی

منبع: arXiv AI