计费精算

OpenAI Prompt Caching 2026 官方价怎么算:命中率门槛与真实 $/M 节省

对账单视角拆解 OpenAI Prompt Caching 输入/缓存字段定价,给出命中率门槛、有效单价公式与常见场景对照,帮助把缓存折扣从理论变成可核对的账单数字。

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:OpenAI Prompt Caching 2026 官方价怎么算:命中率门槛与真实 $/M 节省

## OpenAI Prompt Caching 2026 官方价怎么算:命中率门槛与真实 $/M 节省\n\n分类:计费精算 \nslug:oa-openai-prompt-caching-hit-rate-2026 \n模式:plan_new\n\nOpenAI Prompt Caching 是官方 API 的智能优化功能,专为需要对账单的用户设计。它让重复使用的提示词前缀(prefix)直接从服务器缓存读取,无需重新处理,大幅降低输入成本和延迟。适用于所有 OpenAI 官方 API 用户——包括 ChatGPT API、Plus 计划与纯 API 开发者,尤其是长系统提示、RAG 固定上下文或多轮 Agent 场景。通过命中率计算,你能直接把理论折扣转化为账单可核对的真实节省数字,避免模糊的“大概省多少”。\n\n无论你用 GPT-5.6 系列还是 gpt-5.5 模型,核心都是看命中率(cache hit rate)是否超过 30-40%,就能让有效 $/M 低于无缓存价。OpenAICN 作为 OpenAI 官方 API 计费对照站,帮助读者用 Usage 报表里的 cache_read / cache_write 字段,精确分清 Plus 与 API 的实际支出。\n\n### ## 官方价表字段速读:输入 tokens、缓存命中 tokens、输出 tokens 分别计费\n\nOpenAI Prompt Caching 2026 年已完全融入官方定价,无需额外设置即可自动生效(最低 1,024 tokens 起)。缓存仅影响输入端:\n\n- 常规输入 tokens:按标准价计费(miss 部分或首次写入)。\n- 缓存命中 tokens(cached_tokens):按 1/10 标准输入价计费,即 90% 折扣。\n- 输出 tokens:完全不影响(始终按原输出价)。\n\n部分模型(如 GPT-5.6 系列)首次写入会额外收取 cache_write_tokens(按 1.25 倍标准输入价),后续读取完全便宜。官方文档明确:Prompt Caching 工作在 GPT-4o 及更新模型上,无需代码变更。\n\n官方价表(2026 年 8 月最新,单位:$/1M tokens)\n\n| 模型 | 输入(标准) | 缓存输入(命中) | 输出 | 备注(cache_write) |\n|---------------|--------------|------------------|----------|---------------------|\n| gpt-5.6-sol | $5.00 | $0.50 | $30.00 | $6.25(首次) |\n| gpt-5.6-terra| $2.00 | $0.20 | $12.00 | $2.50(首次) |\n| gpt-5.6-luna | $0.20 | $0.02 | $1.20 | $0.25(首次) |\n| gpt-5.5 | $5.00 | $0.50 | $30.00 | 无额外写入费 |\n| gpt-5.4 | $2.50 | $0.25 | $15.00 | 无额外写入费 |\n\n长上下文(>272K tokens)价格 2 倍,但缓存折扣同样保持。数据直接来自 OpenAI 官方定价页,与 GPT-5.6 及后续系列完全一致。 [[1]](https://developers.openai.com/api/docs/pricing)\n\n### ## 命中率门槛公式:多少比例的重复前缀才能让有效 $/M 低于无缓存价\n\n缓存收益 = 命中率越高越好,但不是越高越好。关键公式如下:\n\n有效输入单价 =(常规输入 tokens × 标准价 + 缓存命中 tokens × 缓存价) / 总输入 tokens\n\n真实节省百分比 = 1 - [(常规输入 × 标准价 + 缓存命中 × 缓存价) / 无缓存总价]\n\n命中率门槛(简化版):\n\n- 阈值:当命中率 > 30% 时,多数工作负载下有效 $/M 已低于无缓存价(输入节省 90% 折扣的边际收益已覆盖写入成本)。\n- 精确突破点:针对 GPT-5.6 系列(有 1.25× 写入费),命中率需 > 42% 才能净节省(考虑首次写入成本)。\n- 长期门槛:> 70% 命中率时,节省通常达 60-80%(推荐结构化提示词实现)。\n\n示例公式(gpt-5.6-terra):\n\n假设总输入 10,000 tokens(常规 2,000 + 命中 8,000):\n\n- 无缓存价:10,000 × $2.00 / 1M = $0.020\n- 有缓存价:2,000 × $2.00 + 8,000 × $0.20 / 1M = $0.004 + $0.0016 = $0.0056\n- 有效 $/M:0.56(节省 72%)\n\n命中率 80% 即可让有效价低于标准。低于 30% 命中率时,基本无节省,甚至因首次写入略增。官方建议:将静态前缀放在提示词开头,动态部分放末尾,可轻松达 85%+ 命中率。\n\n### ## 常见工作负载对照:长系统提示、RAG 固定上下文、多轮 Agent 的缓存收益区间\n\n不同场景收益差异巨大:\n\n| 工作负载类型 | 典型结构 | 预计命中率 | 有效 $/M 节省区间 | 典型应用场景 |\n|--------------------|---------------------------|------------|-------------------|-----------------------|\n| 长系统提示(100K+)| 固定前缀(系统提示 + 规则)| 85-95% | 65-80% | 企业 RAG、知识库 |\n| RAG 固定上下文 | 文档前缀重复 + 查询变化 | 70-90% | 50-75% | 向量检索、多轮问答 |\n| 多轮 Agent | 工具定义 + 历史共享 | 40-70% | 30-60% | 复杂推理代理(如 Cursor) |\n| 单轮/新查询 | 动态内容多 | <30% | 0-10% | 一次性任务 |\n\n在长系统提示或 RAG 场景,缓存能直接把输入成本砍至 1/10。Agent 多轮中,通过 prompt_cache_key 参数可把命中率拉到 70% 以上,节省 40-60%。实际账单核对时,Usage 报表会显示 cache_read_tokens 字段,直接对应节省。\n\n### ## 账单核对要点:Usage 报表里 cache_read / cache_write 字段与发票对应关系\n\nOpenAI Usage 报表(Usage endpoint 或 API Dashboard)提供精确拆分:\n\n- cached_tokens(或 prompt_tokens_details.cached_tokens):命中部分,按缓存价计费。\n- cache_write_tokens(GPT-5.6+):首次写入,按 1.25× 标准输入价计费。\n- prompt_tokens / completion_tokens:总计。\n\n发票(Invoices)直接汇总这些字段,无额外行项目。OpenAICN 官方 API 计费对照站建议:每月导出 Usage CSV,与发票 PDF 对比,可 100% 对齐。缓存贡献的折扣直接体现在 “Input” 列的下降,输出端不变。\n\n### ## 与实时 API、Batch API 叠加时的决策表:延迟、折扣与命中稳定性\n\nPrompt Caching 可叠加使用,但需权衡:\n\n| 场景组合 | 延迟影响 | 折扣叠加 | 命中稳定性 | 推荐场景 |\n|--------------------|----------------|--------------|----------------|-------------------------|\n| Prompt Caching + 实时 API | 缓存后读取更快(降低 80%) | 缓存 + 实时折扣 | 较高(30min+ TTL) | 低延迟 Agent |\n| Prompt Caching + Batch API | 无延迟(异步) | 缓存 + 批处理 50% 折扣 | 稳定 | 批量处理、RAG 离线任务 |\n| 纯实时 vs 批处理 | 实时更低延迟 | 实时无额外批折扣 | 取决于命中率 | 生产交互优先实时 |\n\n在 GPT-5.6+ 中,explicit 模式 + prompt_cache_key 可让高频请求命中率稳定 >70%,适合实时 API 与 Batch 混合场景。缓存不计入 TPM 限流,但会影响路由稳定性。\n\n### ## 实操清单:如何用官方 tokenizer 与用量导出估算下月缓存节省额\n\n1. 登录 OpenAI Platform > API Dashboard,导出 Usage 报表(CSV,含 usage.prompt_tokens_details.cached_tokens)。\n2. 用官方 tiktoken 库或 OpenAI 官方 tokenizer 计算总 prompt_tokens(gpt-5 系列支持)。\n3. 计算命中率 = cached_tokens / prompt_tokens。\n4. 套入公式:下月缓存节省 ≈ ∑(prompt_tokens × 命中率 × 折扣差 × 30 天)。\n5. 建议:设置监控脚本,监控 >70% 命中率工作负载,目标每月节省 40%+ 总输入成本。\n6. 额外:测试不同 prompt_cache_key 路由,提升跨请求命中。\n\n按此清单操作,即可把 OpenAI Prompt Caching 从“理论节省”变成精确可核对的账单数字。缓存是 OpenAI API 官方计费的免费升级,值得每位用户关注。\n\n### ## 风险与边界\n\n缓存命中需精确前缀匹配,若提示词有微小改动(例如动态时间戳)则失效,命中率可能降至 0。首次写入成本在 GPT-5.6+ 模型上需 >42% 命中率才能净省。部分地区数据驻留可能导致 10% 上浮。以上内容仅供参考,非法律意见,实际计费以 OpenAI 官方文档为准。\n\n### ## 延伸阅读\n\n- OpenAI 官方 API 价格一览\n- API 计费全流程指南\n- Prompt Caching 完整结构化提示词模板\n\n### ## English summary\n\nOpenAI Prompt Caching in 2026 delivers automatic 90% input token discounts for matching prefixes (min 1,024 tokens) on GPT-5.6 and later models. Cache reads bill at $0.50/M vs $5.00/M standard on gpt-5.6-sol; first writes on GPT-5.6+ cost 1.25× but yield savings once hit rate exceeds ~42%. Use usage.prompt_tokens_details.cached_tokens vs total prompt_tokens to compute real savings. Static prefixes (system prompts, RAG docs) achieve 70-95% hits and 60-80% input cost reduction. Pair with Batch API for extra 50% discount and prompt_cache_key for routing stability. Reconcile via Usage CSV + invoices for exact accounting. Target >70% hit rate for predictable monthly savings of 40%+ on input spend. Always verify latest rates on official OpenAI pricing page.