刷新

OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少

内容刷新 / GEO:补 English summary 与最新核对清单 — oa-openai-prompt-caching-effective-unit-price

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少

开篇:Prompt Caching 下的有效单价真相

OpenAI Prompt Caching(提示词缓存)并非简单的“打折”,而是通过复用长上下文中不变的部分,显著降低输入 Token 的有效单价。对于高频调用长上下文(如 RAG 系统、长文档分析)的用户,理解“命中后输入$/M 到底降多少”是优化账单的关键。本文基于官方 API 计费逻辑,拆解缓存机制对 $/M tokens 的实际影响,帮助开发者在 Plus 订阅与 API 调用之间做出更精准的财务决策。

现状与数据更新:缓存如何改变 $/M 结构

在 OpenAI 的计费体系中,Prompt Caching 允许用户为重复使用的系统提示词(System Prompt)或长上下文前缀支付更低的费率。当缓存命中(Hit)时,这部分 Token 不再按标准输入价格计费,而是按缓存输入价格计费。

核心计费逻辑

1. 缓存写入(Write):首次将长上下文存入缓存时,按标准输入价格全额计费。

2. 缓存命中(Hit):后续请求若复用相同上下文,仅对新增的 Token 按标准价格计费,而缓存内的 Token 按缓存输入价格计费。

3. 缓存读取(Read):部分模型支持缓存读取,但主要节省体现在输入端。

输入 $/M 降幅对照表

以下数据基于 OpenAI 官方定价模型(以 GPT-4o 和 o1 系列为例,具体价格请以 /official-prices 当日挂牌为准):

模型系列 标准输入 $/M 缓存输入 $/M 降幅比例 适用场景
GPT-4o $2.50 $1.25 50% 长文档分析、RAG 系统
GPT-4o-mini $0.15 $0.075 50% 高频轻量级任务
o1-preview $15.00 $7.50 50% 复杂推理、代码生成
o1-mini $3.00 $1.50 50% 快速推理任务

> 注意:输出 Token(Output Tokens)始终按标准价格计费,不受缓存影响。缓存仅针对输入端的重复部分。

为什么 Plus 用户不直接受益?

ChatGPT Plus 订阅用户使用的是 Web/App 界面,其底层计费逻辑与 API 不同。Plus 用户无法直接访问 Prompt Caching 的 API 接口,因此无法通过此机制降低个人使用成本。只有API 开发者才能通过代码实现上下文复用,从而享受缓存折扣。

核对清单:确保缓存生效并准确对账

在使用 OpenAI API 时,许多开发者误以为只要发送长提示词就能自动享受折扣。实际上,缓存命中需要满足严格条件。请对照以下清单检查您的账单:

  • [ ] 上下文完全一致:缓存键(Cache Control)对应的文本必须与首次写入时完全相同,包括空格和换行。
  • [ ] 使用正确的 API 参数:必须在请求中设置 cache_control 参数(如 {"type": "ephemeral"})。
  • [ ] 检查响应头:在 API 响应中查找 x-ml-cache-hit 或类似字段,确认缓存是否命中。
  • [ ] 区分输入与输出:账单中缓存折扣仅体现在 Input Tokens 部分,Output Tokens 价格不变。
  • [ ] 模型兼容性:确认所用模型支持缓存功能(目前 GPT-4o, GPT-4o-mini, o1 系列均支持)。

常见误判:为什么账单没降?

1. 上下文微小差异:即使是一个多余的空格,也会导致缓存未命中,从而按全价计费。

2. 未设置缓存控制:未显式启用缓存控制,系统不会自动缓存。

3. 缓存过期:部分缓存策略有有效期,过期后需重新写入。

风险边界:缓存带来的隐性成本

虽然 Prompt Caching 能降低输入成本,但也引入了新的复杂性和潜在风险。

1. 缓存未命中的“全价惩罚”

如果缓存策略设计不当,导致大量请求未命中缓存,开发者将支付全额输入费用,而未能享受到任何折扣。这在上下文动态变化较大的场景中尤为常见。

2. 调试难度增加

缓存命中与否直接影响账单,但 API 响应中缓存状态的信息可能不够直观。开发者需要额外编写日志记录逻辑,以追踪缓存命中率,增加了调试和维护成本。

3. 数据一致性风险

在分布式系统中,缓存状态可能在不同节点间不同步。如果多个服务实例同时写入缓存,可能导致不一致的缓存键,进而引发计费混乱。

4. 升级后必挂

OpenAI 可能随时调整缓存策略或价格结构。依赖缓存折扣的计费模型在官方政策变更时可能失效,导致预算超支。建议定期核对 /official-prices 页面,确保计费逻辑与最新政策同步。

> 非法律意见:本文内容仅供参考,不构成法律或财务建议。计费政策以 OpenAI 官方文档为准。

站内路径:快速定位资源