همانطور که مدلهای زبانی بزرگ (LLM) روز به روز حجیمتر میشوند، نیاز به روشهای فشردهسازی (Compression) برای کاهش هزینههای محاسباتی حیاتیتر از همیشه است. اما یک مشکل بزرگ وجود داشت: ترکیب روشهای «تجزیه رتبه پایین» (Low-rank decomposition) و «کوانتیزاسیون» (Quantization) باعث افت عملکرد شدید میشد.
محققان در یک پژوهش جدید، برای اولین بار ثابت کردند که این دو روش با یکدیگر «غیرمتعامد» (Non-orthogonal) هستند و ترکیب ناشیانه آنها نتیجه عکس میدهد. خبر خوب این است که آنها روش نوآورانهای به نام «Diagonal Adhesive Method» یا به اختصار DAM را معرفی کردهاند که میتواند این دو تکنیک را به شکلی بهینه ترکیب کرده و جلوی افت کیفیت مدل را بگیرد.
این تحقیق گامی مهم برای اجرای مدلهای قدرتمند روی سختافزارهای ضعیفتر و موبایلهاست. 💪
سازی_مدل
منبع: arXiv AI
