官方API

OpenAI API 官方 Token 单价速查 2026:GPT-5.6 Luna $0.20/1M + 缓存减半读法

OpenAICN 官方对照站最新 GPT-5.6 系列模型 Token 价格表(输入/输出/缓存字段)、$1M tokens 实际算力、ChatGPT Plus 与 API 分账规则及对账单示例。读者可直接复制对比自家账单,无需查其他站点。

가이드 목록 · 본문은 주로 중국어 간체입니다. 영문 요약(English summary)을 참고하세요.

封面:OpenAI API 官方 Token 单价速查 2026:GPT-5.6 Luna $0.20/1M + 缓存减半读法

OpenAI API 官方 Token 单价速查 2026:GPT-5.6 Luna $0.20/1M + 缓存减半读法

OpenAI API 官方 Token 单价速查 2026 是指通过公开的 GPT-5.6 系列模型定价表格,直接对照自家账单的实用指南。它适用于正在使用 OpenAI API 构建应用或代理的用户,尤其是需要精确计算输入输出 Token 成本、了解 Prompt Caching 减半规则的用户。读者可直接复制账单数据进行对比,无需在多个第三方站点反复查对,就能分清 ChatGPT Plus 与 API 的账单边界,以及如何通过 Batch API 半价或缓存优化每月支出。

本文基于 OpenAI 官方定价页面最新数据(2026 年 7 月 30 日调整后),提供可执行的对账模板。建议读者先访问 OpenAI 官方 API 定价页面,核对自家账单字段,再来本页决策。

GPT-5.6 系列三大模型最新价格表

2026 年 OpenAI 将 GPT-5.6 模型拆分为 Sol、Terra、Luna 三档,分别对应不同工作负载的性价比。以下是标准处理模式下的最新每百万 Token 价格(短上下文 < 270K):

模型 输入 $/M 缓存输入 $/M 输出 $/M
GPT-5.6 Sol $5.00 $0.50 $30.00
GPT-5.6 Terra $2.00 $0.20 $12.00
GPT-5.6 Luna $0.20 $0.02 $1.20

数据来源:OpenAI 官方定价页面。缓存输入按标准规则享受 90% 减半优惠(部分旧模型缓存写入无额外费用,GPT-5.6 系列写入按 1.25 倍输入价)。长上下文模式下价格上浮 100%,缓存写入列额外计费。实际账单字段可能显示 cached_tokenscache_write_tokens,需按官方 SDK 输出对照核实。 [[1]](https://openai.com/api/pricing/)

Prompt Caching 官方规则与命中率计算器

Prompt Caching 是 OpenAI 官方对可重复提示的自动优化功能,2026 年 GPT-5.6 系列已全面支持。核心规则如下:

  • 缓存读:输入 Token 按 90% 优惠计费(缓存输入列直接显示)。
  • 缓存写:GPT-5.6 及之后模型需额外支付 1.25 倍标准输入价,且前缀长度必须 ≥ 1024 Token。隐式断点自动触发,显式断点需在代码中指定 prompt_cache_options.mode: "explicit"
  • 有效期:至少 30 分钟,可更长。
  • 命中率计算:如果提示中 70% 前缀可复用,则有效输入成本 = 总输入 Token ×(1 - 0.7) + 0.1 × 总输入 Token × 0.7。

简单计算器公式(复制到 Excel 或 Python 脚本):


有效成本($/M) = 输入单价 × (1 - 命中率) + 缓存单价 × 命中率

实际账单中,usage.prompt_tokens_details.cached_tokens 字段直接显示命中 Token 数。建议在代码中打印此字段验证。

输入 tokens 与输出 tokens 分别按 $/M 拆分详解

账单通常按 input_tokensoutput_tokens 分项列出。GPT-5.6 Luna 模型适合日常工作,输入成本极低,但输出 Token(尤其是复杂推理)仍占大头。Terra 平衡型适合高频场景,Sol 适合复杂代理但预算更高。

实际算力示例(每月 1000 万 Token):

  • Luna:输入 2000 元 + 输出 1200 元 = 总 3200 元
  • Terra:输入 20000 元 + 输出 12000 元 = 总 32000 元
  • Sol:输入 50000 元 + 输出 30000 元 = 总 80000 元

缓存优化后,Luna 可再降低 80%+。输出 Token 为什么吃预算?因为模型生成逻辑更复杂,Token 数量通常是输入的 3–10 倍。建议将 max_tokens 参数设置为合理上限,并开启 Stream 模式观察 Token 消耗。

ChatGPT Plus 与 OpenAI API 账单必须分账的原因

ChatGPT Plus(20 美元/月)是个人聊天 App 订阅,主要用于 web/app 界面使用,无 API 访问权限。OpenAI API 是独立开发者平台,账单通过 API Key 和组织单独管理,计费字段完全不同(modelinput_tokensoutput_tokens 等)。 [[2]](https://chatai.guide/api/chatgpt-plus-api-access/)

分账原因

  • Plus 支付固定订阅费,不包含 API 配额。
  • API 账单独立,消费 Token 时走不同路由。
  • 账单对比时,API 账单字段(Usage 页面)不会出现在 Plus 账单中。

快速判断清单

  • 账单是否同时显示 api_usage 字段?是 API。
  • 订阅费是否单独列出?是 Plus。
  • 建议将 API Key 关联到单独组织,避免混淆。

Batch API 半价折扣与延迟换折扣决策表

Batch API(异步提交任务,24 小时内处理)对所有 GPT-5.6 模型提供 50% 折扣,适用于非实时高频任务。

决策表(推荐场景):

场景 是否推荐 Batch 原因 替代方案
每日定时数据处理 强烈推荐 50% 节省 + 低延迟可控 标准 API + 缓存
实时聊天/代理调用 不推荐 延迟可能影响用户体验 Fast mode
高峰期 100 万+ Token/日 推荐 节省显著 按需扩容
代码生成/批量推理 推荐 输出量大,半价优势明显 Luna + 缓存

注意:Batch 仅影响标准模式,Fast mode(Sol 2.5 倍速)与 Batch 互斥。实际决策需测试 1–2 天成本。

o 系列推理模型输出 tokens 为什么吃预算

o1/o3 系列(推理模式)默认使用高“努力”参数,内部推理 Token 不直接计费输出,但上下文窗口被占用,导致整体输出 Token 消耗增加。建议明确设置 reasoning_effort: "low""none",可节省 30–50% 预算,同时保持可接受质量。

GPT-4o / o3 / 低配 nano 模型快速对账模板

GPT-4o 快速模板(示例每月数据):

  • 输入 500 万 Token:$12,500
  • 输出 100 万 Token:$5,000
  • 总计:$17,500(加缓存可省 10%+)

o3 推理模板

  • 输入 200 万 + 输出 500 万:$1,400 + $2,000 = $3,400(注意努力参数)

低配 nano 模板(Luna 替代):

  • 日常查询:输入 $0.20/M + 输出 $1.20/M,极低预算友好。

将自家账单数据代入以上公式,即可一键核对。

2026 官方计费更新要点与合规提醒

  • 7 月 30 日调整:Luna 降至 $0.20/1M 输入(80% 降低),Terra 降至 $2/1M。
  • Batch 保持 50% 优惠。
  • 数据地区(如中国相关)需确认 regional processing 是否加 10% 费用。
  • 始终以 OpenAI 官方定价页面为准,避免第三方站点误差。

合规提醒:使用 OpenAI API 须遵守《OpenAI 使用政策》,禁止滥用、恶意攻击或违规服务。账单异常时,建议通过官方 Dashboard 查看 Usage 详情。任何跨境交易请咨询法律顾问。

延伸阅读

风险与边界

本文仅供参考,不构成法律意见。OpenAI API 计费规则可能因地区、版本或合同调整而变。任何决策请以 OpenAI 官方定价页面或账单字段为准,避免因过度优化导致意外支出增加。使用 API 时请务必遵循 OpenAI 官方服务条款。