KV Cache 是 Transformer 推理中的键值缓存机制:把已计算的注意力键值存起来供后续词元复用,避免重复计算,是提升大模型生成速度与吞吐的核心优化。
AI Glossary
KV Cache(键值缓存)是 Transformer 大模型推理时的核心优化技术。生成文本时,模型每生成一个新词元都要重新计算注意力;KV Cache 把已生成词元算出的 Key、Value 缓存起来,新词元只计算自己的部分,避免整段重复计算,显著降低延迟、提升吞吐。
自回归生成是「逐个词元」进行的,若不缓存,生成第 N 个词元时前 N-1 个词元的注意力要全部重算——计算量随序列长度平方增长。KV Cache 让增量推理成为主流,是大模型服务成本与速度的关键变量。
KV Cache 是理解大模型推理成本、并发能力与长上下文支持不可绕开的技术概念。
用通俗中文解释 AI 技术术语,帮助你看懂工具页面里的模型、协议和工作流。