
## OpenAI Prompt Caching 命中率门槛:什么时候缓存才真正省 $/M
OpenAI Prompt Caching(提示词缓存)是官方 API 自动为 GPT-4o 及后续模型提供的功能,能把重复的前缀(通常 1024 个 token 起)以折扣价处理,账单中通过 cached_tokens 字段显示节省金额。它适合重复上下文的场景:多轮对话、Agent 任务、长上下文 ChatGPT Plus API 使用者。
什么时候值得强制开缓存? 命中率超过 60-80% 时,累计节省才能盖过写入成本;低于此门槛,账单可能反而更高。
怎么决策? 用以下公式、表格和账单字段核对即可。数据以官方 API 计费页为准(官方 API 价格),建议结合 API 计费对照 工具验证。
官方价表里 Input / Cached Input 字段怎么读
OpenAI API 账单中会拆解字段:
- prompt_tokens:总输入 token 数(包括缓存和非缓存)
- input_tokens_details.cached_tokens:命中缓存的 token 数(折扣价)
- cache_write_tokens(GPT-5.6 及以后模型):写入缓存的 token 数(按 1.25 倍标准输入价)
- cached_input / Input:模型定价表中的对比字段
官方 API 价格 和 官方定价文档 直接列出了每模型的标准输入与缓存单价。举例:GPT-4o 系列标准输入 $2.50/M,缓存 $1.25/M;o1 系列标准 $15.00/M,缓存 $7.50/M。这些字段直接影响账单总和。
缓存命中后的有效 $/M 计算公式
缓存命中后,有效成本 =(非缓存输入 token + 缓存命中 token 的折扣价 + 输出 token + 写入成本)/ 总 token
简化公式(推荐场景):
$$
\text{有效单价} = \frac{\text{非缓存输入} \times \text{标准价} + \text{缓存命中} \times \text{缓存价} + \text{输出} \times \text{输出价}}{\text{总 token}}
$$
盈亏平衡点:设总上下文 $L$ token、命中率 $h$($0 \leq h \leq 1$)、写入成本 $W$:
$$
\text{总成本} = L \times (1 - h) \times \text{标准价} + h \times L \times \text{缓存价} + W \times \text{写入量}
$$
命中率门槛 = 当总成本 < 无缓存标准成本时所需 $h$。
缓存写入一次 vs 多次命中的累计成本:写入一次可覆盖后续多次命中(缓存保留 5-10 分钟或更长),典型 Agent 任务(system prompt + 工具历史)可达到 $h = 80-90\%$。
账单侧如何核对缓存命中量与折扣金额:对比 cached_tokens 与总输入,乘以模型缓存价差即可验证节省。参考 账单路径 工具页面。
不同模型的命中率盈亏平衡表
下表基于官方定价计算(上下文长度 < 270K,标准处理模式;实际以 官方定价文档 当日数据为准)。阈值 = 总成本 ≤ 无缓存标准成本时的最低命中率。
| 模型 | 标准输入 ($/M) | 缓存输入 ($/M) | 写入成本 ($/M) | 命中率阈值 | 典型适用场景 | 上下文长度示例(100k token) |
|---|---|---|---|---|---|---|
| GPT-4.1 | 2.00 | 0.50 | - | 55% | 日常 ChatGPT API 多轮对话 | $h \geq 55\%$ 可省 20%+ |
| GPT-4.1 mini | 0.40 | 0.10 | - | 60% | 轻量 Agent / mini 任务 | $h \geq 60\%$ 可省 35%+ |
| o1 / o3-mini | 15.00 / 1.10 | 7.50 / 0.55 | - | 75% | 复杂推理任务(适合 o1) | $h \geq 75\%$ 可省 50%+ |
| GPT-5.6 Sol | 5.00 | 0.50 | 6.25 | 80% | 高流量 Agent(写入后稳定) | $h \geq 80\%$ 可省 60%+ |
| GPT-5.6 Terra | 2.00 | 0.20 | 2.50 | 70% | 中高流量批量任务 | $h \geq 70\%$ 可省 45%+ |
| GPT-5.6 Luna | 0.20 | 0.02 | 0.25 | 65% | 低成本日常工作 | $h \geq 65\%$ 可省 80%+ |
数据来源:官方 API 价格 和 官方定价文档。提示:mini 模型阈值较高,适合低命中率场景;旗舰模型阈值低,适合稳定上下文。
上下文长度与缓存写入成本的实际影响
上下文越长(>10k token),缓存收益越高(折扣单价随长度放大)。写入成本影响:GPT-5.6 及以后模型写入一次(1.25× 标准输入)后,后续命中免费折扣处理;提前写入稳定前缀可避免重复写入。
实际影响示例:100k 上下文、$h=70\%$,GPT-5.6 Luna 写入后总成本降至原 80%(缓存写入 0.25/M 摊薄后)。
决策阈值:上下文 < 1k token 基本不缓存;>10k 且命中率 >65% 优先。结合 API 计费对照 工具模拟估算。
账单侧如何核对缓存命中量与折扣金额
1. 导出账单,查看 input_tokens_details.cached_tokens vs prompt_tokens。
2. 计算折扣金额 = cached_tokens × 模型缓存价差。
3. 与 usage 字段总输入对比,验证是否实省。
4. GPT-5.6 后注意 cache_write_tokens(写入)是否已计入。
工具推荐:账单核对工具 可一键对比字段。
什么场景开缓存反而更贵:反例与决策阈值
- 反例:单次调用($h<20\%$)、短上下文(<1k token)、GPT-5.6 以上高写入模型(写入成本被摊薄后仍亏)。
- 决策阈值:命中率 < 50% 或总成本 > 无缓存时,关闭缓存。典型 Agent 任务(system prompt 固定 + 用户历史多轮)最适合,假设 $h=80-90\%$ 可省 50%+。
检查清单:先看账单字段,再模拟上下文长度。
与 Batch API 折扣叠加时的优先级建议
Batch API 整体 -50% 折扣叠加缓存后,优先级:先确保缓存命中率 >60%(盖写成本),再启用 Batch(对静态上下文最优)。o1 系列与 Batch 结合可进一步降至 25% 有效价。
API 计费对照 工具支持叠加模拟。
## 风险与边界
以上基于官方模型定价与缓存机制编写,仅供参考,不构成任何法律意见或投资建议。实际价格、可用性及功能可能随 OpenAI 调整而变化,请以 官方定价文档 和 官方 API 价格 当日数据为准。缓存命中率高度依赖业务上下文设计,建议通过账单字段验证后再投入生产。
延伸阅读
English summary
OpenAI Prompt Caching automatically discounts repeated prompt prefixes (1,024+ tokens) for models like GPT-4o, o1, and GPT-5.6 series, with billing broken down via cached_tokens and cache_write_tokens fields. Effective $/M savings depend on hit rate and context length; calculate breakeven at 55-80% hit rate depending on the model. Official prices show 50-90% input discounts, but writes add cost on GPT-5.6+. Verify directly in your OpenAI dashboard usage logs against the pricing page. Ideal for multi-turn agents with stable system prompts; avoid for one-off or short queries. Batch API discounts combine well after caching. Always check the latest official API pricing page for your specific models and regions. This guide helps readers reconcile bills and decide when caching truly reduces costs.