
2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段详解
OpenAI API 定价在 2026 年已进入 GPT-5.6 时代,价格结构更清晰:每百万(1M)Token 输入、输出和缓存字段分别计费。无需翻阅繁杂文档,即可精准读懂单条 Prompt 成本,帮你避免对账单误差。
如果你经常使用 ChatGPT API、构建 AI 应用或计算每月预算,这份价表就是你的快速指南。它特别适合开发者、分清 ChatGPT Plus 订阅与原生 API 的区别,以及那些需要精确算 $/M 的团队。
1. 2026 OpenAI 官方 API 定价总览(支持模型列表)
OpenAI 将定价简化为标准(Short Context)、长上下文(Long Context)和 Batch 处理三种模式。旗舰系列为 gpt-5.6 家族(Luna、Terra、Sol),辅以 o3 系列推理模型和 GPT-4o 兼容版。
以下是主要模型的标准短上下文输入/输出单价(单位:美元/百万 Token),数据基于官方页面 2026 年 8 月更新:
| 模型名称 | 输入 $/M | 缓存输入 $/M | 输出 $/M | 备注 |
|---|---|---|---|---|
| gpt-5.6 Luna | 0.20 | 0.02 | 1.20 | 最便宜旗舰,适合高频任务 |
| gpt-5.6 Terra | 2.00 | 0.20 | 12.00 | 均衡选择,日常生产工作首选 |
| gpt-5.6 Sol | 5.00 | 0.50 | 30.00 | 最高智能,复杂推理场景 |
| gpt-5.4 | 2.50 | 0.25 | 15.00 | 稳定老旗舰,兼容性强 |
| o3 | 2.00 | 0.50 | 8.00 | 推理模型,思维链加长 |
| GPT-4o | 2.50 | 1.25 | 10.00 | 老旗舰,仍支持多模态 |
长上下文(输入超 270K Token)输入单价通常升至标准 2 倍,输出升至 1.5 倍。Batch 处理整体打 50% 折扣(异步任务适用)。更多完整列表可参考 官方 API 定价页。
2. GPT-4o / o1 / o3 系列核心字段拆解:输入、输出、缓存
OpenAI 将 Token 按功能拆分为三个核心字段,便于你直接对照账单:
- 输入(Input):你提交的 Prompt、系统提示、工具定义等全部内容。一次性请求通常全部计费。
- 输出(Output):模型生成的文本、JSON、代码等可见响应。长度越长,成本越高。
- 缓存(Cache):Prompt Caching 功能自动或显式命中时生效的字段。旧模型(如 GPT-4o 早期)缓存输入单价为输入的 50%;GPT-5.6 系列更激进,降至 10%。
关键区别:
- 推理模型(o3、o1)内部思考(reasoning tokens)全部算作输出,即使你看到的回复很短。
- 多模态输入(图片、音频)按对应文本 Token 计费。
- 缓存字段在响应 JSON 中会单独显示,便于验证命中率。
3. Prompt Caching 字段生效规则与命中率计算
Prompt Caching 是 OpenAI 2024 年后新增的核心优化,自动在连续对话中命中前缀(至少 1024 Token 相同)时生效。规则如下:
- 自动缓存:系统提示、重复用户消息前缀可命中。同一会话中,缓存输入单价大幅降低。
- 显式缓存(GPT-5.6 后支持):使用
extra_body参数控制缓存断点,精确命中特定段落。 - 命中率计算:单条请求成本 =(输入 - 缓存命中 Token)× 输入率 + 缓存命中 Token × 缓存率 + 输出 Token × 输出率。
- 示例:8,000 输入 Token 中 7,000 可缓存,GPT-5.6 Luna 输入率 0.20 → 有效输入成本仅 0.20 × 1,000 = 0.002 美元(节省 99%)。
- GPT-5.6 系列额外收取“缓存写入”(Cache Writes)单价 1.25 倍输入率(首次写入新前缀时)。
实际账单中,prompt_tokens_details.cached_tokens 和 cache_write_tokens 会单独列出,帮助你精确核对。
4. 批量处理与响应流式输出的特殊单价
- Batch API:提交异步任务,24 小时内返回。整体单价打 50%(输入/输出均减半),适合非实时任务。
- 流式输出(Stream):实时生成时,输出 Token 仍按标准率计费,但延迟极低,适合聊天机器人。非流式(同步)同一请求成本相同。
- 长上下文模式下,流式输出仍适用标准长上下文输出率。
这些特殊场景不改变核心定价,但 Batch 可显著降低预算,流式则保持用户体验。
5. 实际账单示例:一个 10k token 中文 Prompt 成本
假设你用 GPT-4o 提交一个 10,000 Token 的中文 Prompt(含 2,000 Token 系统提示 + 8,000 Token 用户消息),输出 500 Token。
- 无缓存:输入 10,000 × 2.50 = 0.025 美元;输出 500 × 10 = 0.005 美元;总计 0.03 美元。
- 开启 Prompt Caching(假设前 7,000 Token 可命中):输入成本 = 3,000 × 2.50 + 7,000 × 1.25 = 0.0075 + 0.00875 = 0.01625 美元;输出仍 0.005 美元;总计 0.02125 美元(节省 29%)。
对比 GPT-5.6 Luna:无缓存总计约 0.0042 美元,缓存后更低。实际对账单以官方字段为准,建议用 官方 API 计费工具 或 API 中转计算器 快速校验。
6. 常见计费陷阱与正确单价核对技巧
- 陷阱 1:忽略 reasoning tokens(o3 等模型内部思考)——回复短但总 Token 高。
- 陷阱 2:长上下文误算——输入超 270K 时未切换长上下文率。
- 陷阱 3:未设置缓存——重复对话成本翻倍。
- 核对技巧:
1. 查看账单 usage JSON 中的 input_tokens_details 和 completion_tokens。
2. 对比官方定价页确认当日汇率(价格每日更新)。
3. 用我们站点工具页面模拟:输入 Token 数和缓存命中比例,自动得出真实成本。
风险与边界
OpenAI API 定价随时可能调整,以官方页面为准。以上内容仅供参考,非法律意见。实际对账请始终以 OpenAI 平台后台数据为准,避免因字段误读导致预算超支。