官方API

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完全指南

最新2026 OpenAI 官方 Token 价表详解:如何从输入/输出/缓存三个字段快速计算 $/M tokens,助你对账单时准确分清 GPT、o 系列与 Prompt Caching 费用。

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完全指南

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完全指南

OpenAI API 用户在处理账单时,最关心的就是如何快速从官方价格表中算出实际费用。2026 年最新官方 Token 价表 把费用拆分成输入 token(Input)、输出 token(Output)和 Prompt Caching(缓存)三个字段,让你一眼看清 GPT-5.6 系列、o3 推理模型与 Plus 订阅的差异。

本文适用所有 OpenAI API 使用者:从个人开发者到企业用户,都能通过这套指南对账单,避免误算 10%–90% 的费用。

OpenAI 2026 官方价格体系总览

OpenAI 把定价从“单价”改成三字段制(输入 / 输出 / 缓存),方便精确对账。核心分两部分:GPT-5.6 系列(性价比高)和 o 系列推理模型(复杂任务更强,但输出字段不同)。

官方挂在 OpenAI 官方 API 计费对照站 的价格表已更新至 2026 年 8 月,以下是标准(Short context)核心模型单价(单位:$/1M tokens):

模型 输入 缓存输入 缓存写 输出 备注
GPT-5.6 Sol $5.00 $0.50 $6.25 $30.00 高性能旗舰
GPT-5.6 Terra $2.00 $0.20 $2.50 $12.00 日常高性价比
GPT-5.6 Luna $0.20 $0.02 $0.25 $1.20 日常最便宜
o3 $2.00 $0.50 $5.00 $8.00 推理任务专用
GPT-4o $2.50 $1.25 - $10.00 老旗舰模型

长上下文(>270K tokens)会多 100% 输入,但缓存写仍按短上下文规则计。所有数据以官方当日挂牌页为准。

输入 token 与输出 token 倍率对比

输入字段是“写给模型的 Prompt”,输出字段是“模型回答的 Response”。两者的倍率差异极大:

  • 标准输入:1 倍(或缓存 0.1 倍)
  • 输出:通常 5–12 倍(o3 系列更低,但内部思考 token 仍算输出)

实际对比(同等任务):

  • 写 Prompt 1000 tokens + 回答 100 tokens:输入 0.002–0.005 美元,输出 0.012–0.06 美元。
  • 推理模型 o3 内部会生成 2000–5000 tokens 思考 token,全算输出,所以总费常是标准模型的 2–4 倍。

输入 vs 输出 倍率关系:输出价格越高,模型越“贵”但质量越强。o3 系列输出仅 8 美元/M,实际任务常因思考 token 推高 30%–50%。

Prompt Caching 的实际计费规则与门槛

Prompt Caching 是 OpenAI 最强省钱功能之一:把静态 Prompt 放缓存,相同前缀的后续请求可省 80%–90% 输入费用。

  • 门槛:Prompt 前 1024+ tokens 必须精确匹配(128 tokens 递增)。
  • GPT-5.6 系列特殊规则(2026 年 7 月后):

- 缓存读:仍按 0.1 倍(90% 折扣)。

- 缓存写:新写费用为正常输入的 1.25 倍(即原 25% 额外)。

- 旧模型(GPT-4o 前):写缓存完全免费。

  • 实际节省:同一系统提示 + 工具定义重复 100 次,可把输入成本降至 1/10。OpenAI 官方文档明确提示缓存自动生效,无需额外代码。

缓存读 vs 写:高频场景(工具调用、模板提示)写入后多次读,2 次读即可回本;单次使用可能不划算。

o 系列推理模型特殊输出计费特点

o 系列(o3、o1 等)是“思考模型”,输出字段不只是最终回答,还包含内部 Chain-of-Thought(思考过程):

  • 官方仅显示最终输出,但 API 响应中会同时返回 completion_tokens_details 中的思考 token(全部按输出价计)。
  • 示例:复杂数学题,o3 可能产生 3000 tokens 思考 + 300 tokens 最终回答,总输出 3300 tokens。
  • 结果:即使输出字段显示 $8/M,实际账单可能等同 $15–25/M 的标准模型。

o3-mini 更亲民(输入 $1.10 / 输出 $4.40),适合日常推理;o3-pro 则 $20/$80,适合顶级任务。

单价计算示例:中文任务怎么估算

假设你写一个中文翻译任务(重复系统提示 + 上下文):

场景:每分钟 1 次,重复提示 3000 tokens,上下文 5000 tokens,输出 200 tokens。

GPT-5.6 Terra 计算

  • 输入:3000(新) + 5000(新) = 8000 tokens @ $2/M
  • 缓存写:8000 @ 1.25 × $2 = $20
  • 缓存读:5000 @ 0.1 × $2 = $1
  • 输出:200 @ $12/M = $2.40
  • 总费用:$23.40(缓存命中率 62.5% 后实际约 $8–10)

o3 计算(无缓存优势):

  • 输入 8000 @ $2 = $16
  • 输出 3300 @ $8 = $26.40
  • 总费用:$42.40(思考 token 推高 50%+)

中文任务优化:把固定系统提示放首位 + 开启 Prompt Caching,Terra 场景可压到 $4–6/次。

账单对账实操:从 price list 到总费用

1. 登录 OpenAI API Dashboard 查看 Usage 页。

2. 找到 prompt_tokens(输入)、completion_tokens(输出)、cache_read_tokens / cache_write_tokens(缓存)。

3. 乘以对应字段单价(官方 /official-prices 页可一键复制)。

4. 加上区域处理 +10%(数据主权场景)。

5. 跨月对比使用量,优先优化缓存命中 >70% 的接口。

检查清单

  • 缓存写是否占输入 20%+ 就值得优化(减少重复提示)。
  • o3 任务是否输出字段过高?换 o4-mini 或 GPT-5.6 Luna。
  • Batch API 可再省 50%。

常见误区与优化建议

误区 1:以为输出字段就是最终费用,其实 o 系列思考 token 隐形多算。

误区 2:忽略缓存写 1.25 倍,频繁新写会浪费。

误区 3:长上下文误当短上下文算(多收 100% 输入)。

优化建议

  • 系统提示 + 模板统一放在首位。
  • 使用 prompt_cache_options 显式断点控制。
  • 高频任务跑 Batch API。
  • 监控 usage.total_tokens vs 预估,及时下调模型(如 Luna > Terra > Sol)。

风险与边界

以上基于公开官方数据整理,仅供参考。实际计费以 OpenAI Dashboard 显示为准,存在速率限制、地区差异等边界。请勿依赖本文进行商业决策或绕过政策。

免责声明:本文非法律意见,仅供技术对账参考。OpenAI 价格可能随时调整,请以官方定价页为准。

延伸阅读