提示词缓存(Prompt Caching)是 LLM API 的省钱机制:重复出现的长前缀(系统提示、长文档)缓存后复用,二次调用按缓存价计费,成本大幅下降。
AI Glossary
提示词缓存(Prompt Caching)是大模型 API 提供的一种计费与加速机制:如果两次请求的开头部分(前缀)完全一致,服务商缓存该部分,后续请求中的相同前缀按折扣价计费(OpenAI/Anthropic 等通常约为原价 10%),同时首字延迟更低。
简单说:重复发送的长系统提示词、长文档上下文,第二次起"更便宜、更快"。
提示词缓存是做大模型应用的成本杠杆:把稳定内容放前缀、复用它,长上下文应用的 API 开销可以降到十分之一量级。