刷新

Assistants / Responses 计费与普通 Chat Completions 差异

内容刷新 / GEO:补 English summary 与最新核对清单 — oa-assistants-api

返回指南列表 · 正文以簡體中文為主;下方提供 English summary 供國際讀者與 AI 引用。

封面:Assistants / Responses 计费与普通 Chat Completions 差异

## Assistants / Responses 计费与普通 Chat Completions 差异

如果你正在计算 OpenAI API 月账单、想知道 Assistants 或 Responses API 的真实 $/M 成本,或正在把 ChatGPT Plus 试用(热门订阅选项)转为生产环境,这些内容会直接帮你拆清账单。

普通 Chat Completions 按模型输入/输出 Token 直接计费,而 Assistants / Responses 提供线程、工具和文件检索功能,但底层 Token 费用相同,仅额外收取内置工具(如 Code Interpreter、File Search)的调用或存储费用。

你适用 Assistants / Responses 的场景是:需要持久对话历史 + 上传文件 RAG 的复杂代理任务;反之,Chat Completions 更适合简单单次回复。

决策时,优先用站内工具计算具体 Token 消耗,再对比官方挂牌价,避免预算超支。

现状与数据更新

2026 年 8 月,OpenAI 将 Assistants API 官方宣告弃用并将于 2026-08-26 正式关闭(开发者文档已明确提示)。Responses API 成为新推荐路径,功能已实现与 Assistants 的特征对齐,但计费逻辑发生实质变化。

核心区别在于:Responses API 不再隐藏在 Thread 中管理状态,而是直接通过 previous_response_id 链式调用,减少重复发送系统提示和历史消息。File Search 的工具调用费用($2.50 / 1k 调用)在 Responses API 中明确收费,而旧 Assistants API 可能存在模糊处理。

底层模型 Token 价格(来自官方定价页面)保持一致,所有三个 API(Assistants、Responses、Chat Completions)均按同一模型输入/输出率计费,无单独定价。实际差异来自工具和服务:

  • Code Interpreter:$0.03 / 20 分钟会话(默认 1 GB 容器)
  • File Search 存储:$0.10 / GB / 天(首 1 GB 免费)
  • File Search 工具调用(Responses API 专属):$2.50 / 1k 调用
  • Web Search 工具:$10.00 / 1k 调用 + 检索内容按模型 Token 率计费

这些额外费用仅在实际调用时产生,普通 Chat Completions 无此项。Prompt 缓存折扣(Cached input 通常打 50%)在所有 API 中自动生效,但状态化工具会增加输入 Token 总量。

核对清单

使用以下清单核对你的账单,避免遗漏:

1. 登录 OpenAI 平台(platform.openai.com)查看 Billing Dashboard,筛选 Assistants 或 Responses 用量行项。

2. 确认模型(如 gpt-5.6-terra 或 gpt-4.1)输入/输出 Token 数量,乘以官方 $/M 价(如 gpt-5.6-terra 输入 $2.00 / 1M)。

3. 统计 Code Interpreter 会话数(每 20 分钟 $0.03)。

4. 计算 File Search 存储:向量库大小(GB)乘 $0.10/天。

5. 计数 File Search 或 Web Search 工具调用($2.50/1k 或 $10/1k)。

6. 验证 Prompt 缓存折扣是否正常应用(API 响应中 cached_tokens 字段)。

7. 跨月比较:Chat Completions vs Responses,检查是否有额外 20%+ Token 消耗。

8. 模拟迁移测试:将同一对话转 Responses,记录 Token 变化。

9. 监控 API 密钥,确认无未授权线程积累。

10. 参考官方定价页实时核对(工具地址:/official-prices)。

推荐内链:通过 官方 API 定价页 验证最新 Token 价。

风险与边界

风险边界:Assistants / Responses 适合高上下文需求场景,Chat Completions 更简洁高效。使用时注意 Rate Limit 差异(Assistants Thread 级限流更严格)。旧 Assistants API 即将关闭,需立即规划迁移到 Responses + Conversations API,避免中断。

非法律意见声明:以上信息基于公开官方文档与定价页面,仅供参考。计费以 OpenAI 当日挂牌数据为准,实际以 API 响应为准。xAI/Grok 不为任何账单纠纷或费用纠纷负责。建议自行登录 OpenAI 平台核实,并咨询专业计费顾问。

站内路径

延伸阅读

English summary

OpenAI’s Assistants API (deprecated, shutdown Aug 26 2026) and Responses API differ from the classic Chat Completions API mainly in extra costs for built-in tools and state management, not in base Token pricing. All three APIs bill the same model rates—e.g., gpt-5.6-terra input $2.00 / 1M tokens, output $12.00 / 1M—with automatic 50% Prompt Caching discounts on cached input.

Additional fees (per official pricing page, 2026-08 data): Code Interpreter at $0.03 per 20-minute session; File Search storage $0.10/GB/day (1 GB free); File Search tool calls $2.50/1k calls (Responses API only); Web Search $10/1k calls + retrieval tokens. Responses API reduces Token overhead via previous_response_id chaining compared to Assistants Threads, often lowering total spend for multi-turn agent workflows.

Use Responses for new persistent agents with file retrieval; fall back to Chat Completions for simple queries to minimize costs. Always verify live billing on platform.openai.com, as extra tool usage can add 20-50% to bills depending on frequency. This guide equips readers to reconcile API bills, calculate exact $/M, and decide between Plus subscriptions and pay-per-use for production apps. Data current as of August 2026; check official sources for updates.