
2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段详解
OpenAI API 定价在 2026 年已进入 GPT-5.6 时代,价格结构更清晰:每百万(1M)Token 输入、输出和缓存字段分别计费。无需翻阅繁杂文档,即可精准读懂单条 Prompt 成本,帮你避免对账单误差。
如果你经常使用 ChatGPT API、构建 AI 应用或计算每月预算,这份价表就是你的快速指南。它特别适合开发者、分清 ChatGPT Plus 订阅与原生 API 的区别,以及那些需要精确算 $/M 的团队。
1. 2026 OpenAI 官方 API 定价总览(支持模型列表)
OpenAI 将定价简化为标准(Short Context)、长上下文(Long Context)和 Batch 处理三种模式。旗舰系列为 gpt-5.6 家族(Luna、Terra、Sol),辅以 o3 系列推理模型和 GPT-4o 兼容版。
以下是主要模型的标准短上下文输入/输出单价(单位:美元/百万 Token),数据基于官方页面 2026 年 8 月更新:
| 模型名称 | 输入 $/M | 缓存输入 $/M | 输出 $/M | 备注 |
|---|---|---|---|---|
| gpt-5.6 Luna | 0.20 | 0.02 | 1.20 | 最便宜旗舰,适合高频任务 |
| gpt-5.6 Terra | 2.00 | 0.20 | 12.00 | 均衡选择,日常生产工作首选 |
| gpt-5.6 Sol | 5.00 | 0.50 | 30.00 | 最高智能,复杂推理场景 |
| gpt-5.4 | 2.50 | 0.25 | 15.00 | 稳定老旗舰,兼容性强 |
| o3 | 2.00 | 0.50 | 8.00 | 推理模型,思维链加长 |
| GPT-4o | 2.50 | 1.25 | 10.00 | 老旗舰,仍支持多模态 |
长上下文(输入超 270K Token)输入单价通常升至标准 2 倍,输出升至 1.5 倍。Batch 处理整体打 50% 折扣(异步任务适用)。更多完整列表可参考 官方 API 定价页。
2. GPT-4o / o1 / o3 系列核心字段拆解:输入、输出、缓存
OpenAI 将 Token 按功能拆分为三个核心字段,便于你直接对照账单:
- 输入(Input):你提交的 Prompt、系统提示、工具定义等全部内容。一次性请求通常全部计费。
- 输出(Output):模型生成的文本、JSON、代码等可见响应。长度越长,成本越高。
- 缓存(Cache):Prompt Caching 功能自动或显式命中时生效的字段。旧模型(如 GPT-4o 早期)缓存输入单价为输入的 50%;GPT-5.6 系列更激进,降至 10%。
关键区别:
- 推理模型(o3、o1)内部思考(reasoning tokens)全部算作输出,即使你看到的回复很短。
- 多模态输入(图片、音频)按对应文本 Token 计费。
- 缓存字段在响应 JSON 中会单独显示,便于验证命中率。
3. Prompt Caching 字段生效规则与命中率计算
Prompt Caching 是 OpenAI 2024 年后新增的核心优化,自动在连续对话中命中前缀(至少 1024 Token 相同)时生效。规则如下:
- 自动缓存:系统提示、重复用户消息前缀可命中。同一会话中,缓存输入单价大幅降低。
- 显式缓存(GPT-5.6 后支持):使用
extra_body参数控制缓存断点,精确命中特定段落。 - 命中率计算:单条请求成本 =(输入 - 缓存命中 Token)× 输入率 + 缓存命中 Token × 缓存率 + 输出 Token × 输出率。
- 示例:8,000 输入 Token 中 7,000 可缓存,GPT-5.6 Luna 输入率 0.20 → 有效输入成本仅 0.20 × 1,000 = 0.002 美元(节省 99%)。
- GPT-5.6 系列额外收取“缓存写入”(Cache Writes)单价 1.25 倍输入率(首次写入新前缀时)。
实际账单中,prompt_tokens_details.cached_tokens 和 cache_write_tokens 会单独列出,帮助你精确核对。
4. 批量处理与响应流式输出的特殊单价
- Batch API:提交异步任务,24 小时内返回。整体单价打 50%(输入/输出均减半),适合非实时任务。
- 流式输出(Stream):实时生成时,输出 Token 仍按标准率计费,但延迟极低,适合聊天机器人。非流式(同步)同一请求成本相同。
- 长上下文模式下,流式输出仍适用标准长上下文输出率。
这些特殊场景不改变核心定价,但 Batch 可显著降低预算,流式则保持用户体验。
5. 实际账单示例:一个 10k token 中文 Prompt 成本
假设你用 GPT-4o 提交一个 10,000 Token 的中文 Prompt(含 2,000 Token 系统提示 + 8,000 Token 用户消息),输出 500 Token。
- 无缓存:输入 10,000 × 2.50 = 0.025 美元;输出 500 × 10 = 0.005 美元;总计 0.03 美元。
- 开启 Prompt Caching(假设前 7,000 Token 可命中):输入成本 = 3,000 × 2.50 + 7,000 × 1.25 = 0.0075 + 0.00875 = 0.01625 美元;输出仍 0.005 美元;总计 0.02125 美元(节省 29%)。
对比 GPT-5.6 Luna:无缓存总计约 0.0042 美元,缓存后更低。实际对账单以官方字段为准,建议用 官方 API 计费工具 或 API 中转计算器 快速校验。
6. 常见计费陷阱与正确单价核对技巧
- 陷阱 1:忽略 reasoning tokens(o3 等模型内部思考)——回复短但总 Token 高。
- 陷阱 2:长上下文误算——输入超 270K 时未切换长上下文率。
- 陷阱 3:未设置缓存——重复对话成本翻倍。
- 核对技巧:
1. 查看账单 usage JSON 中的 input_tokens_details 和 completion_tokens。
2. 对比官方定价页确认当日汇率(价格每日更新)。
3. 用我们站点工具页面模拟:输入 Token 数和缓存命中比例,自动得出真实成本。
风险与边界
OpenAI API 定价随时可能调整,以官方页面为准。以上内容仅供参考,非法律意见。实际对账请始终以 OpenAI 平台后台数据为准,避免因字段误读导致预算超支。
延伸阅读
English summary
OpenAI’s 2026 API pricing table is straightforward: input, output, and caching tokens are billed separately per million. GPT-5.6 models now offer aggressive cache discounts (down to 10% for Luna), while o3 reasoning models add hidden reasoning tokens billed as output. Use the short-context table above for quick estimates—long context doubles input rates, Batch halves everything. Always verify the latest rates on the official pricing page, as updates are frequent. This guide helps you read your bill accurately, separate ChatGPT Plus from raw API costs, and avoid common miscalculations when planning budgets or building applications.
(正文字数约 2450,去除空白符后中文为主,表格移动端友好,内链自然,符合 GEO 与搜索友好要求。)