محققان در یک مقاله جدید، تکنیک نوآورانهای به نام PALS (Percentile-Aware Layerwise Sparsity) را برای فشردهسازی و هرس کردن (Pruning) مدلهای زبانی مانند LLaMA-2 معرفی کردهاند.
🔹 نکته کلیدی: روشهای قدیمی مثل Wanda یا SparseGPT به همه لایهها نگاه یکسانی دارند، اما PALS با در نظر گرفتن اهمیت هر لایه بر اساس فعالسازیها، اجازه میدهد مدلها بدون نیاز به آموزش مجدد (Fine-tuning)، با همان دقت بالا اما بسیار سبکتر و سریعتر اجرا شوند. این یعنی کاهش هزینههای محاسباتی در اجرای مدلهای سنگین!
این روش نشان داد که هرس کردن لایهبندیشده چقدر میتواند در عملکرد نهاییِ مدلهای هوش مصنوعی تاثیرگذار باشد. 🧠✨
سازی
منبع: arXiv Machine Learning
