
2026 OpenAI API Token 价格全指南:GPT-5.6 系列输入/输出/缓存字段读法
这是 OpenAI GPT-5.6 系列(Sol / Terra / Luna)输入、输出和 Prompt Caching 的完整定价指南。适合正在使用 OpenAI API 进行对账、预算规划或优化成本的开发者与企业用户。
GPT-5.6 最新模型家族与定价变化
2026 年 7 月 30 日后,OpenAI 对 GPT-5.6 家族进行了官方定价调整:Terra 和 Luna 价格大幅下降(Terra 降 20%,Luna 降 80%),Sol 保持不变。Fast mode(原 Priority)也同步上线,适合追求速度的场景。
三大主力模型定位清晰:
- gpt-5.6-sol:旗舰模型,适合复杂代理、代码、生物医学等高难度任务,智能最强但单价最高。
- gpt-5.6-terra:均衡型,日常工作、推理、多轮对话最优选择,性价比突出。
- gpt-5.6-luna:最快最便宜,适合高频调用、批量任务,适合日常使用。
定价对比表(标准处理,每百万 tokens):
| 模型 | 输入(短上下文) | Cached input | Cache writes | 输出(短上下文) | 输入(长上下文) | 输出(长上下文) |
|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $1.80 |
数据来源:OpenAI 官方定价页面(https://openai.com/api/pricing/)。长上下文(>272K tokens)按双倍输入计费,输出按 1.5 倍计费。数据托管区域处理额外 +10% 费用。
输入/输出/缓存字段完整读法与示例
OpenAI API 对账单中最关键的字段是 usage.prompt_tokens、usage.completion_tokens 和 usage.total_tokens(或 cache_read_interaction_id / cache_creation_interaction_id)。理解这些就能精确对账:
- 输入:用户 prompt(system + user messages)。缓存命中时只计费 Cached input 部分。
- 输出:模型生成 tokens(completion)。
- 缓存:Prompt Caching 专属字段,read 按 90% 折扣,write 按 1.25 倍输入单价。
- 示例(使用
/v1/chat/completions):
messages: [
{"role": "system", "content": "You are a helpful assistant. [fixed system prompt]"}, // 可缓存
{"role": "user", "content": "今天天气怎么样?"} // 可缓存
]
重复调用相同系统提示时,第二次 read 只计费 $0.50(Sol)或 $0.20(Terra),节省 90%。
字段速查:
- cached_input:成功命中时的计费价格。
- cache_writes:首次缓存或 breakpoint 切换时的额外费用。
- 注意:缓存必须至少存活 30 分钟,建议设置明确 breakpoint(如
<CACHE_BREAK>)。
Prompt Caching 什么时候省钱:命中率门槛与节省公式
Prompt Caching 是 GPT-5.6 最强性价比点:缓存读取价格仅为标准输入的 10%。
节省公式:
节省金额 = (未缓存输入价格 - 缓存输入价格) × 缓存命中 tokens × 次数
示例:Terra 模式下,系统 prompt(1000 tokens)缓存一次,之后 10 次调用:
- 每次节省 = ($2.00 - $0.20) × 1000 = $1.80
- 10 次共省 $18(输入总成本从 $20 降到 $2)。
命中率门槛:
- 建议 >60% 命中率即可看到明显节省。
- 低命中(<30%)时,不建议开启缓存(写费用更高)。
- 策略:将固定系统提示、工具定义、知识库前缀提前缓存;长上下文用 breakpoint 分段。
实际效果:高频代理工作(工具调用重复)命中率常达 80-95%,单月可省 40-70% 成本。
Batch API 与 Fast 模式折扣计算
- Batch API(异步):输入和输出均享 50% 折扣。示例:
Standard: $2 / $12 (Terra)
Batch: $1 / $6
适合离线批量处理任务(如训练数据生成、批量推理)。
- Fast 模式(service_tier: "fast",原 Priority):Sol 模式下速度提升至标准 2.5 倍,价格翻倍:
Standard: $5 / $30 (Sol)
Fast: $10 / $60
Terra / Luna Fast 同样按翻倍计费,适合追求低延迟的实时应用。
计算示例:一天处理 1 万条请求(每条 500 tokens),用 Terra Batch 可将成本降至标准的一半。
不同场景 Token 消耗估算(中文/英文/长上下文)
| 场景 | 典型 prompt 长度 | 推荐模型 | 估算输入 tokens | 估算输出 tokens | 标准总价(Sol) | 缓存优化后总价(Sol) |
|---|---|---|---|---|---|---|
| 中文日常对话 | 500 tokens | Terra | 500 | 200 | $1.20 | $0.10 |
| 英文长上下文代码 | 10 万 tokens | Sol | 10 万 | 1 万 | $50 | $5 |
| 批量工具调用 | 200 tokens | Luna | 200 | 100 | $0.20 | $0.004 |
| 长上下文代理 | 30 万 tokens | Sol | 30 万 | 2 万 | $200 | $15 |
中文 vs 英文:两者消耗相似,英文输出略多(约 10-20%),但语义更紧凑。建议先用 Luna 跑基准测试,再切换到 Terra。
对账单关键字段位置与每月预算模板
- 对账单位置:OpenAI 平台 > Billing > API Usage > 导出 CSV。关键列:prompt_tokens、completion_tokens、cost(美元)、cache_字段。
- 每月预算模板(Excel/表格示例):
| 日期 | 模型 | 总 tokens | 输入 tokens | 输出 tokens | 缓存读 tokens | 总花费 ($) | 备注 |
|---|---|---|---|---|---|---|---|
| 2026-08-01 | Terra | 1,500,000 | 800,000 | 700,000 | 500,000 | 14.40 | 缓存命中率 62.5% |
| ... | ... | ... | ... | ... | ... | ... | ... |
建议设置自动预算警报,目标:每月 < $100(Terra),< $500(Sol)。
2026 年最新价表更新要点
- July 30 调整:Terra/Luna 大幅降价,Luna 成为性价比之王。
- 新增 Fast mode:速度翻倍,价格 2x。
- 长上下文定价双倍输入。
- 缓存写入 1.25x 输入(首次写需谨慎)。
- 所有价格均为 USD / 百万 tokens,实时波动以 OpenAI 官方为准。
延伸阅读
风险与边界
以上内容仅供参考,非法律意见。OpenAI API 定价可能因政策、地区或促销随时调整,请以官方定价页面(https://openai.com/api/pricing/)为准。使用中若遇到计费疑问,建议直接联系 OpenAI 支持团队。