محققان با معرفی معماری جدیدی به نام HiKV، گام بلندی برای حل یکی از بزرگترین چالشهای مدلهای زبانی بزرگ (LLM)، یعنی کندی و مصرف حافظه بالای KV Cache برداشتهاند.
💡 این تکنولوژی جدید با ترکیب هوشمندانه الگوریتم و سختافزار، حافظه را به صورت سلسلهمراتبی فشرده میکند. نتیجه؟ تا ۸ برابر سرعت بیشتر و کاهش ۹۰ درصدی مصرف انرژی در محاسبات توجه (Attention)، بدون افت کیفیت پاسخها! این یعنی مدلهای غولآسا در آیندهای نزدیک، سریعتر و بهینهتر روی سختافزارهای معمولیتر اجرا خواهند شد.
آیندهی پردازشهای هوش مصنوعی با چنین نوآوریهایی، هر روز کارآمدتر میشود. نظر شما چیست؟ آیا این سرعت بالا میتواند تجربه چتباتها را کاملاً متحول کند؟
منبع: arXiv AI
