یکی از بزرگترین چالشهای مدلهای زبانی در پردازش متون فوقطولانی (Ultra-Long Context)، مصرف سنگین حافظه GPU توسط KV Cache است. محققان به تازگی با معرفی معماری «Lookahead Sparse Attention» در مدل DeepSeek-V4، این بنبست را شکستهاند! 🧠⚡
نکات کلیدی این دستاورد:
🔹 کاهش چشمگیر ۹۰ درصدی حجم KV Cache در حافظه GPU.
🔹 افزایش سرعت پردازش و کاهش هزینه محاسبات برای هر توکن (تا ۰.۳ برابر حالت معمول).
🔹 حفظ و حتی بهبود دقت مدل در بنچمارکهای طولانیمتن (LongBench-v2).
🔹 استفاده از استراتژی آموزش بدون نیاز به بارگذاری کل مدل روی GPU.
این یعنی در آینده نزدیک میتوانیم مدلهایی با حافظه متنی عظیم را با سختافزار بسیار ارزانتر و سریعتر اجرا کنیم! 💻🔥
سیک
منبع: arXiv AI
