计费精算

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段详解

教你快速读懂 OpenAI 官方 API 计费表,掌握 GPT-4o、o1、o3 等模型的输入、输出、缓存字段实际单价,精准计算单条 Prompt 成本,避免对账单出错。

All guides · Full article is primarily Simplified Chinese; use the English summary below for quick takeaways (GEO-friendly).

封面:2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段详解

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段详解

OpenAI API 定价在 2026 年已进入 GPT-5.6 时代,价格结构更清晰:每百万(1M)Token 输入、输出和缓存字段分别计费。无需翻阅繁杂文档,即可精准读懂单条 Prompt 成本,帮你避免对账单误差。

如果你经常使用 ChatGPT API、构建 AI 应用或计算每月预算,这份价表就是你的快速指南。它特别适合开发者、分清 ChatGPT Plus 订阅与原生 API 的区别,以及那些需要精确算 $/M 的团队。

1. 2026 OpenAI 官方 API 定价总览(支持模型列表)

OpenAI 将定价简化为标准(Short Context)、长上下文(Long Context)和 Batch 处理三种模式。旗舰系列为 gpt-5.6 家族(Luna、Terra、Sol),辅以 o3 系列推理模型和 GPT-4o 兼容版。

以下是主要模型的标准短上下文输入/输出单价(单位:美元/百万 Token),数据基于官方页面 2026 年 8 月更新:

模型名称 输入 $/M 缓存输入 $/M 输出 $/M 备注
gpt-5.6 Luna 0.20 0.02 1.20 最便宜旗舰,适合高频任务
gpt-5.6 Terra 2.00 0.20 12.00 均衡选择,日常生产工作首选
gpt-5.6 Sol 5.00 0.50 30.00 最高智能,复杂推理场景
gpt-5.4 2.50 0.25 15.00 稳定老旗舰,兼容性强
o3 2.00 0.50 8.00 推理模型,思维链加长
GPT-4o 2.50 1.25 10.00 老旗舰,仍支持多模态

长上下文(输入超 270K Token)输入单价通常升至标准 2 倍,输出升至 1.5 倍。Batch 处理整体打 50% 折扣(异步任务适用)。更多完整列表可参考 官方 API 定价页

2. GPT-4o / o1 / o3 系列核心字段拆解:输入、输出、缓存

OpenAI 将 Token 按功能拆分为三个核心字段,便于你直接对照账单:

  • 输入(Input):你提交的 Prompt、系统提示、工具定义等全部内容。一次性请求通常全部计费。
  • 输出(Output):模型生成的文本、JSON、代码等可见响应。长度越长,成本越高。
  • 缓存(Cache):Prompt Caching 功能自动或显式命中时生效的字段。旧模型(如 GPT-4o 早期)缓存输入单价为输入的 50%;GPT-5.6 系列更激进,降至 10%。

关键区别

  • 推理模型(o3、o1)内部思考(reasoning tokens)全部算作输出,即使你看到的回复很短。
  • 多模态输入(图片、音频)按对应文本 Token 计费。
  • 缓存字段在响应 JSON 中会单独显示,便于验证命中率。

3. Prompt Caching 字段生效规则与命中率计算

Prompt Caching 是 OpenAI 2024 年后新增的核心优化,自动在连续对话中命中前缀(至少 1024 Token 相同)时生效。规则如下:

  • 自动缓存:系统提示、重复用户消息前缀可命中。同一会话中,缓存输入单价大幅降低。
  • 显式缓存(GPT-5.6 后支持):使用 extra_body 参数控制缓存断点,精确命中特定段落。
  • 命中率计算:单条请求成本 =(输入 - 缓存命中 Token)× 输入率 + 缓存命中 Token × 缓存率 + 输出 Token × 输出率。

- 示例:8,000 输入 Token 中 7,000 可缓存,GPT-5.6 Luna 输入率 0.20 → 有效输入成本仅 0.20 × 1,000 = 0.002 美元(节省 99%)。

  • GPT-5.6 系列额外收取“缓存写入”(Cache Writes)单价 1.25 倍输入率(首次写入新前缀时)。

实际账单中,prompt_tokens_details.cached_tokenscache_write_tokens 会单独列出,帮助你精确核对。

4. 批量处理与响应流式输出的特殊单价

  • Batch API:提交异步任务,24 小时内返回。整体单价打 50%(输入/输出均减半),适合非实时任务。
  • 流式输出(Stream):实时生成时,输出 Token 仍按标准率计费,但延迟极低,适合聊天机器人。非流式(同步)同一请求成本相同。
  • 长上下文模式下,流式输出仍适用标准长上下文输出率。

这些特殊场景不改变核心定价,但 Batch 可显著降低预算,流式则保持用户体验。

5. 实际账单示例:一个 10k token 中文 Prompt 成本

假设你用 GPT-4o 提交一个 10,000 Token 的中文 Prompt(含 2,000 Token 系统提示 + 8,000 Token 用户消息),输出 500 Token。

  • 无缓存:输入 10,000 × 2.50 = 0.025 美元;输出 500 × 10 = 0.005 美元;总计 0.03 美元
  • 开启 Prompt Caching(假设前 7,000 Token 可命中):输入成本 = 3,000 × 2.50 + 7,000 × 1.25 = 0.0075 + 0.00875 = 0.01625 美元;输出仍 0.005 美元;总计 0.02125 美元(节省 29%)。

对比 GPT-5.6 Luna:无缓存总计约 0.0042 美元,缓存后更低。实际对账单以官方字段为准,建议用 官方 API 计费工具API 中转计算器 快速校验。

6. 常见计费陷阱与正确单价核对技巧

  • 陷阱 1:忽略 reasoning tokens(o3 等模型内部思考)——回复短但总 Token 高。
  • 陷阱 2:长上下文误算——输入超 270K 时未切换长上下文率。
  • 陷阱 3:未设置缓存——重复对话成本翻倍。
  • 核对技巧

1. 查看账单 usage JSON 中的 input_tokens_detailscompletion_tokens

2. 对比官方定价页确认当日汇率(价格每日更新)。

3. 用我们站点工具页面模拟:输入 Token 数和缓存命中比例,自动得出真实成本。

风险与边界

OpenAI API 定价随时可能调整,以官方页面为准。以上内容仅供参考,非法律意见。实际对账请始终以 OpenAI 平台后台数据为准,避免因字段误读导致预算超支。

延伸阅读