计费精算

OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

2026 年 OpenAI 官方 Prompt Caching 缓存价格及命中率门槛详解,输入输出 tokens 各 $0.15 / M(GPT-4o-mini),缓存节省倍率 50%~80% 计算公式与实际对账单对比表

返回指南列表

封面:OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

## OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

OpenAI Prompt Caching 是官方 API 计费核心节省渠道。它自动为重复提示词前缀(prefix)提供折扣,无需手动启用或修改代码。适用于高频调用场景,如系统提示词重复或多轮对话。

谁适用? 开发者、产品经理和对账单负责人。如何决策? 当你的提示词前缀长度 ≥1024 tokens 且命中率 >50% 时,缓存即可显著降低输入 token 费用,避免对账单超支。

缓存节省倍率指南(GPT-4o-mini 与 o1 系列)帮你快速算出实际省钱效果,避免乱用导致意外账单。

OpenAI 官方 Prompt Caching 是什么:官方 API 计费核心概念

Prompt Caching(提示词缓存)让 OpenAI API 自动跳过重复处理已缓存的前缀,节省时间和费用。缓存仅影响输入 token,输出 token 不变。

核心规则:

  • 自动触发:只要提示词前缀与最近请求完全匹配且 ≥1024 tokens。
  • 命中后,缓存 token 以 50%~80% 折扣计费。
  • 无额外写费(GPT-5.6 系列后写费 1.25 倍,未写费模型仍免费写入)。
  • 保留期:5-10 分钟空闲,最高 1 小时;部分模型支持 24 小时扩展保留。

在对账单中,你会看到 cached_tokens 字段,标记命中量。这就是官方 API 计费最主要的节省工具之一。

2026 年官方缓存价格表:输入输出 / 缓存 $/M 最新字段

2026 年官方价格已随模型迭代更新,以下是当前公开字段(per 1M tokens):

Model Uncached Input Cached Input Output
GPT-4o-mini $0.15 $0.075 $0.60
o1-preview $15.00 $7.50 $60.00
o1-mini $3.00 $1.50 $12.00
GPT-4o (基准) $2.50 $1.25 $10.00

来源:OpenAI 官方定价与 Prompt Caching 指南。GPT-4o-mini 是最适合缓存优化的模型,因其低单价和高调用量。

命中率门槛:缓存什么时候真的省钱(50%+ 实测案例)

缓存并非对所有请求都省钱。有效门槛:

  • 最小前缀:1024 tokens(低于则不缓存)。
  • 命中率门槛:>50% 时才具节省价值。低于 30% 建议优化提示词结构。

实测案例(GPT-4o-mini,高频场景)

  • 系统提示词 2000 tokens,80 000 次调用,日均 5000 次请求。
  • 命中率 80%:输入缓存节省 50%(从 $0.15/M 到 $0.075/M)。
  • 每月节省约 $6,500(输入部分)。

低命中率场景(<50%):输出 token 占预算 70%+ 时,缓存效果有限。建议用 prompt_cache_key 参数优化路由。

官方 API 缓存 vs 实时 API 账单对比:实际对账单省钱公式

常规实时 API 不缓存时,全量按 $0.15/M 输入计费。启用缓存后:

省钱公式


节省 = (prompt_tokens / 1M) × 请求次数 × (uncached_rate - cached_rate) × hit_rate

实际对账单对比表(每日 5000 调用,系统提示词 2000 tokens):

场景 命中率 缓存输入费用 总计输入费用 月节省(估算)
实时 API 0% $750 $750 0
缓存(50% 命中) 50% $375 $375 $11,000
缓存(80% 命中) 80% $150 $150 $18,000

输出 token 始终按 $0.60/M 计费。实际对账单中,usage.prompt_tokens_details.cached_tokens 会直接体现在账单中。

o 系列推理模型缓存应用场景:输出 tokens 为何吃掉预算

o1 系列(o1-preview、o1-mini)输出 token 费用极高($60/$12),缓存输入虽有折扣,但核心应用场景是长上下文推理

适合缓存场景:

  • 每次调用重复的系统提示词 + 工具定义(前缀相同)。
  • 跨多轮对话时,缓存历史前缀可减少重复处理。

预算挑战

  • 单一推理链输出 tokens 可达 10,000+,而输入缓存后仍按较高单价(如 o1 $7.50/M cached)。
  • 实际对账单:如果输出占 60% 预算,缓存输入节省微乎其微,重点是路由到 GPT-4o-mini 而非纯 o1 推理。

ChatGPT Plus 与 OpenAI API 账单为什么必须分账(缓存分账规则)

ChatGPT Plus(用户订阅)与 OpenAI API(开发者密钥)账单完全独立。缓存分账规则

  • Plus 用户:无缓存功能,输入输出按固定额度消耗。
  • API 用户:缓存直接影响 API 账单,Plus 不受影响。
  • 分账必要性:避免混淆对账单。API 账单才计入 Prompt Caching 节省,Plus 账单只看订阅额度。

必须分开对账:否则会错误统计“节省”或超限。建议用不同密钥管理。

Prompt 缓存价格全流程:从 token 数到最终对账单步骤

1. 获取 token 数:用官方 token counter 或本地工具统计提示词前缀长度。

2. 配置 cache:无需代码改动,直接发送包含长前缀的请求。

3. 查看命中:响应中查看 cached_tokens,计算命中率。

4. 计算账单:输入缓存部分按 $0.075/M(GPT-4o-mini)计费,输出全额。

5. 优化:用 prompt_cache_key 提高命中率,监控每月账单下降。

实际步骤示例:每月 1M 输入、1M 输出调用,命中率 70% 时,总费用从 $1,750 降至 $1,100。

---

延伸阅读

Risk 与 Boundary

本指南仅供参考,不构成法律意见。OpenAI 定价可能随时间调整,实际对账以官方 dashboard 为准。任何绕过支付或非官方使用行为均属违规,不在本文讨论范围。

---

English summary

OpenAI Prompt Caching in 2026 provides automatic 50-80% discounts on repeated input token prefixes for models like GPT-4o-mini and o1. Official cached input prices are $0.075/M for GPT-4o-mini (vs $0.15/M uncached) and $7.50/M for o1-preview (vs $15.00/M). Cache activation requires ≥1,024 tokens prefix with >50% hit rate for meaningful savings. Output tokens remain at full price, so o1 reasoning models still face high costs despite input caching. Separate billing rules apply: ChatGPT Plus and OpenAI API accounts are independent, with caching only affecting API statements. The full workflow involves checking usage details, calculating savings via the formula above, and optimizing prefixes for higher hit rates. This guide helps developers reconcile real billing statements and avoid overages when using the official OpenAI API.