
## OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南
OpenAI Prompt Caching 是官方 API 计费核心节省渠道。它自动为重复提示词前缀(prefix)提供折扣,无需手动启用或修改代码。适用于高频调用场景,如系统提示词重复或多轮对话。
谁适用? 开发者、产品经理和对账单负责人。如何决策? 当你的提示词前缀长度 ≥1024 tokens 且命中率 >50% 时,缓存即可显著降低输入 token 费用,避免对账单超支。
缓存节省倍率指南(GPT-4o-mini 与 o1 系列)帮你快速算出实际省钱效果,避免乱用导致意外账单。
OpenAI 官方 Prompt Caching 是什么:官方 API 计费核心概念
Prompt Caching(提示词缓存)让 OpenAI API 自动跳过重复处理已缓存的前缀,节省时间和费用。缓存仅影响输入 token,输出 token 不变。
核心规则:
- 自动触发:只要提示词前缀与最近请求完全匹配且 ≥1024 tokens。
- 命中后,缓存 token 以 50%~80% 折扣计费。
- 无额外写费(GPT-5.6 系列后写费 1.25 倍,未写费模型仍免费写入)。
- 保留期:5-10 分钟空闲,最高 1 小时;部分模型支持 24 小时扩展保留。
在对账单中,你会看到 cached_tokens 字段,标记命中量。这就是官方 API 计费最主要的节省工具之一。
2026 年官方缓存价格表:输入输出 / 缓存 $/M 最新字段
2026 年官方价格已随模型迭代更新,以下是当前公开字段(per 1M tokens):
| Model | Uncached Input | Cached Input | Output |
|---|---|---|---|
| GPT-4o-mini | $0.15 | $0.075 | $0.60 |
| o1-preview | $15.00 | $7.50 | $60.00 |
| o1-mini | $3.00 | $1.50 | $12.00 |
| GPT-4o (基准) | $2.50 | $1.25 | $10.00 |
来源:OpenAI 官方定价与 Prompt Caching 指南。GPT-4o-mini 是最适合缓存优化的模型,因其低单价和高调用量。
命中率门槛:缓存什么时候真的省钱(50%+ 实测案例)
缓存并非对所有请求都省钱。有效门槛:
- 最小前缀:1024 tokens(低于则不缓存)。
- 命中率门槛:>50% 时才具节省价值。低于 30% 建议优化提示词结构。
实测案例(GPT-4o-mini,高频场景):
- 系统提示词 2000 tokens,80 000 次调用,日均 5000 次请求。
- 命中率 80%:输入缓存节省 50%(从 $0.15/M 到 $0.075/M)。
- 每月节省约 $6,500(输入部分)。
低命中率场景(<50%):输出 token 占预算 70%+ 时,缓存效果有限。建议用 prompt_cache_key 参数优化路由。
官方 API 缓存 vs 实时 API 账单对比:实际对账单省钱公式
常规实时 API 不缓存时,全量按 $0.15/M 输入计费。启用缓存后:
省钱公式:
节省 = (prompt_tokens / 1M) × 请求次数 × (uncached_rate - cached_rate) × hit_rate
实际对账单对比表(每日 5000 调用,系统提示词 2000 tokens):
| 场景 | 命中率 | 缓存输入费用 | 总计输入费用 | 月节省(估算) |
|---|---|---|---|---|
| 实时 API | 0% | $750 | $750 | 0 |
| 缓存(50% 命中) | 50% | $375 | $375 | $11,000 |
| 缓存(80% 命中) | 80% | $150 | $150 | $18,000 |
输出 token 始终按 $0.60/M 计费。实际对账单中,usage.prompt_tokens_details.cached_tokens 会直接体现在账单中。
o 系列推理模型缓存应用场景:输出 tokens 为何吃掉预算
o1 系列(o1-preview、o1-mini)输出 token 费用极高($60/$12),缓存输入虽有折扣,但核心应用场景是长上下文推理。
适合缓存场景:
- 每次调用重复的系统提示词 + 工具定义(前缀相同)。
- 跨多轮对话时,缓存历史前缀可减少重复处理。
预算挑战:
- 单一推理链输出 tokens 可达 10,000+,而输入缓存后仍按较高单价(如 o1 $7.50/M cached)。
- 实际对账单:如果输出占 60% 预算,缓存输入节省微乎其微,重点是路由到 GPT-4o-mini 而非纯 o1 推理。
ChatGPT Plus 与 OpenAI API 账单为什么必须分账(缓存分账规则)
ChatGPT Plus(用户订阅)与 OpenAI API(开发者密钥)账单完全独立。缓存分账规则:
- Plus 用户:无缓存功能,输入输出按固定额度消耗。
- API 用户:缓存直接影响 API 账单,Plus 不受影响。
- 分账必要性:避免混淆对账单。API 账单才计入 Prompt Caching 节省,Plus 账单只看订阅额度。
必须分开对账:否则会错误统计“节省”或超限。建议用不同密钥管理。
Prompt 缓存价格全流程:从 token 数到最终对账单步骤
1. 获取 token 数:用官方 token counter 或本地工具统计提示词前缀长度。
2. 配置 cache:无需代码改动,直接发送包含长前缀的请求。
3. 查看命中:响应中查看 cached_tokens,计算命中率。
4. 计算账单:输入缓存部分按 $0.075/M(GPT-4o-mini)计费,输出全额。
5. 优化:用 prompt_cache_key 提高命中率,监控每月账单下降。
实际步骤示例:每月 1M 输入、1M 输出调用,命中率 70% 时,总费用从 $1,750 降至 $1,100。
---
延伸阅读
Risk 与 Boundary
本指南仅供参考,不构成法律意见。OpenAI 定价可能随时间调整,实际对账以官方 dashboard 为准。任何绕过支付或非官方使用行为均属违规,不在本文讨论范围。
---