
## 2026 OpenAI GPT-5.6 Terra 与 Luna 官方 $/M Token 价格详解:输入/输出/缓存完整对照
OpenAI GPT-5.6 Terra 和 Luna 是 2026 年 7 月 30 日 API 大降价后的主力模型。Terra 适合日常高量任务,Luna 则专为成本敏感型工作优化。读者查对账单时,这两款模型的定价直接决定每月支出。以下指南基于官方数据,提供完整对照表、缓存省钱公式、Batch 折扣规则以及与 ChatGPT Plus 的分账建议,帮助开发者准确计算并优化成本。
GPT-5.6 Terra & Luna 官方最新价表(标准 vs 长上下文 vs 缓存字段)
OpenAI 官方定价页面明确列出,Terra 和 Luna 的基础价格在 7 月 30 日后进行了调整(输入与输出均下调)。缓存读入仍享受 90% 折扣,写缓存按 1.25 倍基础输入单价计算。长上下文场景下,输入超 272K tokens 时,完整请求价格按 2 倍输入 + 1.5 倍输出调整。
| 模型 | 标准输入 $/M | 缓存读入 $/M | 缓存写 $/M | 标准输出 $/M | 长上下文输入 $/M | 长上下文输出 $/M |
|---|---|---|---|---|---|---|
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $18.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $1.80 |
数据来源于 OpenAI 官方 API 定价页。Terra 输入单价对大部分生产负载仍具竞争力,而 Luna 的极低价格使其适合批量处理或低复杂性任务。 [[1]](https://developers.openai.com/api/docs/models/gpt-5.6-terra.md) [[2]](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)
Batch API 50%折扣 + 倍率有效单价全解析
Batch API 支持一次性提交大量请求,OpenAI 官方提供最高 50% 折扣(实际以当前挂牌为准)。使用 batch 端点时,折扣单价 = 标准单价 × 0.5。
示例(Terra):
- 标准输入:$2.00/M
- 批量输入有效单价:$1.00/M
开发者可将批量任务全路由至 Terra 或 Luna,避免逐请求导致的延迟与额外开销。官方文档推荐在 Batch 队列中优先选择高命中率的缓存写任务,以进一步降低单价。
Prompt Caching 命中率门槛与省钱公式
Prompt Caching 是 Terra 和 Luna 的核心省钱机制。OpenAI 要求缓存有效期最少 30 分钟,命中率需达 50% 以上才能触发 90% 折扣(低于门槛则按标准输入计费)。写缓存时,首次或更新后的内容按 1.25 倍基础输入单价。
省钱公式(每月估算):
- 节省 = (输入 tokens × 标准 $/M - 输入 tokens × 缓存 $/M) × 命中率
- 实际支出 = (输入 tokens × 缓存 $/M) + (输出 tokens × 输出 $/M)
例如,月处理 10 亿输入 tokens(其中 60% 命中缓存)、1 亿输出 tokens 的 Terra 任务:
- 标准输入成本:$20,000
- 实际输入成本:$4,000
- 输出成本:$1,200
- 总节省约 $14,800
长期对话或系统提示重复使用时,建议提前写缓存并监控命中率。OpenAI 官方文档建议开发者构建缓存命中率监控仪表盘,用于决策是否继续缓存。 [[3]](https://developers.openai.com/api/docs/pricing)
Fast 模式 vs 标准模式价格与延迟决策表
Fast 模式(通过 service_tier: "fast" 或 priority 参数启用)适用于对延迟敏感的任务。OpenAI 官方规定,Fast 模式在标准价格基础上增加 1 倍费用(双倍),但速度提升约 2.5 倍(部分场景)。
| 模式 | 价格调整 | 延迟影响 | 适用场景示例 | 推荐决策 |
|---|---|---|---|---|
| 标准模式 | 基准价 | 正常 | 批量处理、离线任务 | 大量低复杂度工作 |
| Fast 模式 | +100% | 提升 2.5 倍 | 实时客服、代理确认场景 | 需要快速响应的交互任务 |
Terra 和 Luna 均支持 Fast 模式。开发者可通过 API 请求参数灵活切换,结合任务优先级和预算进行决策。长期使用时,建议在监控面板中对比实际延迟与成本,避免盲目启用 Fast 模式。
数据 residency 区域处理 10% 上浮规则
OpenAI 支持数据 residency 区域(例如 AWS 中国区域),新发布模型(2026 年 3 月 5 日后)在此类端点处理时,价格上浮 10%。Terra 和 Luna 同样适用。
- 标准全球端点:基础价格
- 数据 residency 端点(中国等):输入/输出价格各 +10%
开发者在创建项目时选择区域时,需核对官方支持列表,避免意外增加支出。
ChatGPT Plus 与 API 账单必须分账的必要性
ChatGPT Plus($20/月)包含有限 API 额度,可消费至 API 定价(Terra/Luna 通常按官方单价)。开发者必须明确区分两类账单:
- Plus 账单:固定订阅费 + 额度消耗
- API 账单:纯 token 消费,按官方 $/M 计算
未分账会导致对账时混淆额度与额外支出。OpenAI 建议通过 API Keys 单独管理 Plus 额度与独立 API 密钥,避免跨账单错误。实际使用中,建议每月用站内工具计算 Plus 剩余额度与 API 支出。
实际对账单示例:每月不同任务的真实花费估算
假设月度任务量:
- 任务 A(Terra 长上下文):输入 5000 万 tokens(50% 缓存命中),输出 1000 万 tokens
- 任务 B(Luna 标准):输入 2 亿 tokens,输出 2000 万 tokens
- 任务 C(Fast Terra):输入 1000 万 tokens,输出 200 万 tokens
估算成本(USD):
- 任务 A:标准输入 $1000 - 缓存节省 $700 + 输出 $120 = $420
- 任务 B:$400 + $24 = $424
- 任务 C:$100 + $24 = $124
- 总计:约 $968
实际对账单中,缓存命中率和任务路由是最大变量。开发者可复制上述公式,结合自身 token 统计表调整。
2026年7月后价格变化历史与未来更新提示
7 月 9 日 GPT-5.6 系列发布时,Terra 价格 $2.50/$15,Luna $1/$6;7 月 30 日大降价后调整为当前 $2/$12 与 $0.20/$1.20。Sol 保持不变。未来 OpenAI 可能进一步优化(参考官方博客),建议每月查看官方定价页确认最新数据。
延伸阅读
风险与边界
以上内容仅供参考,实际对账单以 OpenAI 官方 API 挂牌价格和账单记录为准。价格可能因地区、升级或促销发生变化。OpenAICN 网站不构成法律意见,仅为开发者实用指南。
English summary
OpenAI GPT-5.6 Terra and Luna received major price cuts on July 30, 2026, with Terra now at $2/M input and $12/M output, and Luna at $0.20/M input and $1.20/M output. Both support prompt caching (90% discount on reads, 1.25x on writes) and Batch API with up to 50% off. Fast mode adds 100% cost for 2.5x speed. Data residency adds 10% uplift. Separate billing from ChatGPT Plus is required for accuracy. Real monthly cost examples show significant savings with caching. Prices were lower on launch and adjusted post-July 30; check the official pricing page for updates. These details help developers reconcile bills and optimize API spending accurately.
(正文字数约 2480 字符)