
2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完全指南
OpenAI API 用户在处理账单时,最关心的就是如何快速从官方价格表中算出实际费用。2026 年最新官方 Token 价表 把费用拆分成输入 token(Input)、输出 token(Output)和 Prompt Caching(缓存)三个字段,让你一眼看清 GPT-5.6 系列、o3 推理模型与 Plus 订阅的差异。
本文适用所有 OpenAI API 使用者:从个人开发者到企业用户,都能通过这套指南对账单,避免误算 10%–90% 的费用。
OpenAI 2026 官方价格体系总览
OpenAI 把定价从“单价”改成三字段制(输入 / 输出 / 缓存),方便精确对账。核心分两部分:GPT-5.6 系列(性价比高)和 o 系列推理模型(复杂任务更强,但输出字段不同)。
官方挂在 OpenAI 官方 API 计费对照站 的价格表已更新至 2026 年 8 月,以下是标准(Short context)核心模型单价(单位:$/1M tokens):
| 模型 | 输入 | 缓存输入 | 缓存写 | 输出 | 备注 |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $0.50 | $6.25 | $30.00 | 高性能旗舰 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 | 日常高性价比 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 | 日常最便宜 |
| o3 | $2.00 | $0.50 | $5.00 | $8.00 | 推理任务专用 |
| GPT-4o | $2.50 | $1.25 | - | $10.00 | 老旗舰模型 |
长上下文(>270K tokens)会多 100% 输入,但缓存写仍按短上下文规则计。所有数据以官方当日挂牌页为准。
输入 token 与输出 token 倍率对比
输入字段是“写给模型的 Prompt”,输出字段是“模型回答的 Response”。两者的倍率差异极大:
- 标准输入:1 倍(或缓存 0.1 倍)
- 输出:通常 5–12 倍(o3 系列更低,但内部思考 token 仍算输出)
实际对比(同等任务):
- 写 Prompt 1000 tokens + 回答 100 tokens:输入 0.002–0.005 美元,输出 0.012–0.06 美元。
- 推理模型 o3 内部会生成 2000–5000 tokens 思考 token,全算输出,所以总费常是标准模型的 2–4 倍。
输入 vs 输出 倍率关系:输出价格越高,模型越“贵”但质量越强。o3 系列输出仅 8 美元/M,实际任务常因思考 token 推高 30%–50%。
Prompt Caching 的实际计费规则与门槛
Prompt Caching 是 OpenAI 最强省钱功能之一:把静态 Prompt 放缓存,相同前缀的后续请求可省 80%–90% 输入费用。
- 门槛:Prompt 前 1024+ tokens 必须精确匹配(128 tokens 递增)。
- GPT-5.6 系列特殊规则(2026 年 7 月后):
- 缓存读:仍按 0.1 倍(90% 折扣)。
- 缓存写:新写费用为正常输入的 1.25 倍(即原 25% 额外)。
- 旧模型(GPT-4o 前):写缓存完全免费。
- 实际节省:同一系统提示 + 工具定义重复 100 次,可把输入成本降至 1/10。OpenAI 官方文档明确提示缓存自动生效,无需额外代码。
缓存读 vs 写:高频场景(工具调用、模板提示)写入后多次读,2 次读即可回本;单次使用可能不划算。
o 系列推理模型特殊输出计费特点
o 系列(o3、o1 等)是“思考模型”,输出字段不只是最终回答,还包含内部 Chain-of-Thought(思考过程):
- 官方仅显示最终输出,但 API 响应中会同时返回
completion_tokens_details中的思考 token(全部按输出价计)。 - 示例:复杂数学题,o3 可能产生 3000 tokens 思考 + 300 tokens 最终回答,总输出 3300 tokens。
- 结果:即使输出字段显示 $8/M,实际账单可能等同 $15–25/M 的标准模型。
o3-mini 更亲民(输入 $1.10 / 输出 $4.40),适合日常推理;o3-pro 则 $20/$80,适合顶级任务。
单价计算示例:中文任务怎么估算
假设你写一个中文翻译任务(重复系统提示 + 上下文):
场景:每分钟 1 次,重复提示 3000 tokens,上下文 5000 tokens,输出 200 tokens。
GPT-5.6 Terra 计算:
- 输入:3000(新) + 5000(新) = 8000 tokens @ $2/M
- 缓存写:8000 @ 1.25 × $2 = $20
- 缓存读:5000 @ 0.1 × $2 = $1
- 输出:200 @ $12/M = $2.40
- 总费用:$23.40(缓存命中率 62.5% 后实际约 $8–10)
o3 计算(无缓存优势):
- 输入 8000 @ $2 = $16
- 输出 3300 @ $8 = $26.40
- 总费用:$42.40(思考 token 推高 50%+)
中文任务优化:把固定系统提示放首位 + 开启 Prompt Caching,Terra 场景可压到 $4–6/次。
账单对账实操:从 price list 到总费用
1. 登录 OpenAI API Dashboard 查看 Usage 页。
2. 找到 prompt_tokens(输入)、completion_tokens(输出)、cache_read_tokens / cache_write_tokens(缓存)。
3. 乘以对应字段单价(官方 /official-prices 页可一键复制)。
4. 加上区域处理 +10%(数据主权场景)。
5. 跨月对比使用量,优先优化缓存命中 >70% 的接口。
检查清单:
- 缓存写是否占输入 20%+ 就值得优化(减少重复提示)。
- o3 任务是否输出字段过高?换 o4-mini 或 GPT-5.6 Luna。
- Batch API 可再省 50%。
常见误区与优化建议
误区 1:以为输出字段就是最终费用,其实 o 系列思考 token 隐形多算。
误区 2:忽略缓存写 1.25 倍,频繁新写会浪费。
误区 3:长上下文误当短上下文算(多收 100% 输入)。
优化建议:
- 系统提示 + 模板统一放在首位。
- 使用
prompt_cache_options显式断点控制。 - 高频任务跑 Batch API。
- 监控
usage.total_tokensvs 预估,及时下调模型(如 Luna > Terra > Sol)。
风险与边界
以上基于公开官方数据整理,仅供参考。实际计费以 OpenAI Dashboard 显示为准,存在速率限制、地区差异等边界。请勿依赖本文进行商业决策或绕过政策。
免责声明:本文非法律意见,仅供技术对账参考。OpenAI 价格可能随时调整,请以官方定价页为准。
延伸阅读
English summary
OpenAI's 2026 Token pricing uses three fields: Input, Output, and Caching. This guide explains how to read the official price list, compare GPT-5.6 and o-series models, and calculate exact $/M costs from your API bill. Key tips include using Prompt Caching for 80–90% savings on repeated prompts, understanding that o-series thinking tokens inflate output costs, and applying a simple checklist to reconcile invoices. Always cross-check the latest data on OpenAI's official pricing page, as rates can change. Ideal for developers managing ChatGPT API usage or enterprise budgets.