محققان در مقاله جدیدی به بررسی چالش هندسه KV-Cache در هنگام آموزش مدلهای زبانی پرداختهاند. این پژوهش نشان میدهد که با استفاده از یک تکنیک منظمسازی (Regularization) خاص در حین آموزش، میتوان همبستگیهای مزاحم در وضعیتهای پنهان (Hidden-state anisotropy) را تا ۹۴٪ کاهش داد.
این دستاورد باعث میشود که مدلها هنگام استفاده از روشهای کوانتش (Quantization) برای کاهش حجم حافظه، عملکرد بسیار پایدارتری داشته باشند و دقت مدل در نرخهای فشردهسازی بالا حفظ شود. این یک گام مهم برای اجرای بهینهتر مدلهای بزرگ روی سختافزارهای محدود است. 🧠💻
منبع: arXiv Machine Learning
