桃子桃子快讯
返回首页
研究论文

KVBoost:块级 KV 缓存复用加速大模型推理

论文提出 KVBoost 系统,支持任意位置的块级 KV 缓存复用,在 Qwen2.5-3B 上将首 token 时延降…

2026.08.25 · 周二4 分钟阅读

一篇问题:LLM 推理的「预填充」瓶颈与 KV 缓存复用

基于 Transformer 的大语言模型在推理时需要为每个请求重新计算键值(KV)张量,由此产生的「预填充」(prefill)时延是推理服务的主要开销之一。现有的前缀缓存(prefix caching)方案虽然能复用 KV 计算结果,但要求共享内容必须出现在提示词的连续前缀位置——一旦共享片段散落在文档任意位置,这一优化便失效。

近日发表于 arXiv 的论文 KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference(编号 2608.21362v1)提出了一套块级 KV 缓存复用系统 KVBoost,目标是在不修改模型结构的前提下,让 Hugging Face 兼容的解码器模型能够复用任意位置的缓存内容。

二、核心机制:双哈希键与边界修复

KVBoost 的设计包含几个相互配合的模块:

  • 双哈希键控(Dual-Hash Keying):将位置标识(前缀哈希)与内容标识(内容哈希)分离,既支持精确匹配,也支持近似匹配,突破了「必须共享连续前缀」的限制。
  • 选择性重算(SelectiveRecompute):对独立缓存块拼接处的注意力边界区域重新编码,修复因块独立缓存带来的边界误差。
  • 偏差引导重算(CacheBlendRecompute):先做一次「探测」前向传播,找出偏差较大的 token,仅对这些 token 重算 KV,进一步控制修复开销。
  • 非对称 KV 量化:支持 int8 与 int4 混合精度量化,在固定显存预算下提升缓存密度。
  • 自适应块边界切分与重要性加权淘汰:根据内容动态调整块大小,并按 token 重要性决定缓存淘汰顺序。

整体设计强调「即插即用」:无需改动模型架构,兼容基于 RoPE(旋转位置编码)的模型。

三、实验结果:首 token 时延下降约 4.5 倍

论文在 Qwen/Qwen2.5-3B 模型上,以 1,000 条 bug-localization 样本作为评测输入,报告了以下数据:

  • 首 token 时延(TTFT):从 639.1 ms 降至 142.4 ms,约 4.49 倍加速;
  • 相对前缀缓存:在相同条件下比传统前缀缓存再快 约 16%
  • 准确率:99.2% vs. 99.1%,基本无损,甚至略高于基线。

作者同时指出,系统在固定显存预算下运行,并通过重要性加权淘汰策略控制内存占用。

四、意义与局限

KVBoost 面向的是推理服务侧的工程优化场景,特别是「共享内容分布在提示词任意位置」的任务——例如检索增强生成(RAG)拼接多段文档、代码 bug 定位中复用文件片段等。其优势在于兼容现有 Hugging Face 模型,无需重新训练或结构调整;同时通过偏差引导重算,将修复边界误差的成本控制在可接受范围内。

需要注意的是,论文目前仅在 Qwen2.5-3B 与单一任务上做了完整评测,其在更大模型、更长上下文或不同任务类型下的泛化表现仍待进一步验证。此外,缓存匹配依赖内容哈希的设计,在面对高度重复的模板化内容时可能产生较多缓存命中,但也需关注近似匹配的误命中风险。

整体而言,这是一篇定位清晰的系统类研究工作,为 LLM 推理加速提供了一个「不依赖连续前缀」的可复用方案。

信源