اگر در حوزه توسعه مدلهای زبانی (LLM) فعالیت میکنید، حتما با چالش افت کیفیت مدل هنگام افزایش طول پنجره متنی (Context Window) برخورد داشتهاید.
متد جدیدی به نام LinearARD معرفی شده که با استفاده از تکنیک «تقطیر توجه» (Attention Distillation)، اجازه میدهد مدلهای بزرگ بدون از دست دادن کیفیت در متنهای کوتاه، برای پردازش توالیهای بسیار طولانی (مثل افزایش از 4K به 32K در LLaMA2) بهینه شوند.
نکته جذاب اینجاست که این روش با مصرف حافظه بسیار کمتر و تنها با استفاده از ۴.۲۵ میلیون توکن (در مقایسه با ۲۵۶ میلیون توکن در روشهای قدیمی)، عملکرد بهتری ارائه میدهد. یک دستاورد عالی برای کاهش هزینههای آموزش مدلهای هوش مصنوعی!
🔗 جزئیات و دسترسی به کد در گیتهاب
منبع: arXiv AI
