计费精算

OpenAI Realtime API 计费拆解:按秒计费与 Token 消耗的双重账单

深度解析 OpenAI Realtime API 的非常规计费模式:除了标准的输入/输出 Token 单价,重点拆解“按秒计费”的隐藏成本。通过具体场景计算,对比标准 Chat Completions 与 Realtime 在语音交互任务下的真实 $/M 成本差异,助你对清每一笔 API 账单。

返回指南列表 · 正文以簡體中文為主;下方提供 English summary 供國際讀者與 AI 引用。

封面:OpenAI Realtime API 计费拆解:按秒计费与 Token 消耗的双重账单

Realtime API 计费结构概览:Token 费用与按秒费用的独立计算逻辑\n\nOpenAI Realtime API 并非传统的文本生成接口,而是一套专为语音交互设计的流式服务。对于开发者而言,最核心的认知转变在于:Realtime API 的账单由两部分独立且并行的费用组成。第一部分是标准的 Token 消耗费用(输入/输出/缓存),第二部分是独特的 按秒计费费用(Audio Duration)。这意味着,即使你的对话文本极短,只要音频流持续传输,按秒计费就会持续累积。这种双重计费模式使得 Realtime API 在长时语音助手场景中,成本结构与标准 Chat Completions 存在显著差异。\n\n在深入计算之前,必须明确 Realtime API 的核心计费参数。与 GPT-4o 等模型不同,Realtime API 使用专用的 gpt-4o-realtime-preview-2024-10-01 模型进行推理,但其音频处理(Speech-to-Text 和 Text-to-Speech)通常由 Whisper 和 TTS 模型处理,这些子任务往往也有自己的计费逻辑或包含在主模型费率中(具体需严格参照官方最新定价页 /official-prices)。目前主流理解中,Realtime API 的“按秒计费”主要针对模型处理音频流的全程时长。\n\n## 按秒计费详解:用户/助手音频时长如何转化为美元成本\n\nRealtime API 的“按秒计费”是其区别于文本 API 的最大特征。根据 OpenAI 官方定价策略,Realtime API 的费率通常高于标准的 GPT-4o 文本模型。\n\n* 输入 Token 单价:$0.006 / 1M tokens\n* 输出 Token 单价: $0.02 / 1M tokens\n* 按秒计费单价: $0.00 / 秒 (注:早期预览期或特定阶段可能免费,但正式商用阶段通常涉及复杂的时长计费,或包含在模型推理费中。*修正:根据2024年10月后最新定价,Realtime API 主要按 Token 计费,但音频处理(STT/TTS)若单独调用则另有单价。若 Realtime API 作为一个整体服务,其“按秒”概念常指代音频流的传输与处理时间,在某些计费视图中,若未单独拆分 STT/TTS,需特别注意官方是否将音频处理时间折算为等值 Token 或单独收费。*\n\n*重要澄清*:截至最新官方文档,OpenAI Realtime API 的计费主要严格遵循 Token 计价(参考 GPT-4o 实时预览版费率)。然而,许多开发者误以为存在独立的“每秒 $X”费用。实际上,Realtime API 本身没有独立的“每秒美元”费率,但其音频输入/输出的 Token 计算方式非常特殊:\n1. 音频输入 (STT):音频时长会转化为等价的 Token 数量。例如,1 秒的音频可能相当于约 100-150 个 Token(取决于采样率和编码)。\n2. 音频输出 (TTS):生成的音频时长同样转化为 Token 数量。\n\n因此,所谓的“按秒计费”实质上是高 Token 密度的音频数据处理。1 分钟的语音交互,其 Token 消耗可能相当于数千个文本 Token。这种“隐性”的 Token 消耗是账单超支的主要原因。\n\n## 场景模拟:语音助手对话中,Token 消耗与时长费用的占比分析\n\n为了看清真实成本,我们构建一个典型的语音助手场景:用户问“今天天气如何?”,助手回答“今天晴天,25度。”\n\n文本模式 (Chat Completions):\n* 输入 Prompt: ~50 tokens\n* 输出 Response: ~50 tokens\n* 总 Token: ~100 tokens\n* 成本 (GPT-4o): $0.000015 (极低)\n\nRealtime API 模式:\n* 用户音频输入 (1.5秒): 约 200 tokens\n* 模型推理: ~100 tokens\n* 助手音频输出 (2.0秒): 约 300 tokens\n* 总 Token: ~600 tokens\n* 成本 (GPT-4o Realtime): $0.000045\n\n虽然单次对话成本依然很低,但在高频交互中,音频 Token 的密度远高于文本。若用户连续说话 10 秒,Token 消耗可能瞬间突破 2000+,成本呈指数级上升。\n\n| 交互类型 | 文本 Token 估算 | 音频等效 Token 估算 | 成本差异倍数 (vs 文本) | 主要成本驱动因素 |\n| :--- | :--- | :--- | :--- | :--- |\n| 短文本问答 | 100 | N/A | 1x | 纯文本推理 |\n| 10秒语音对话 | 100 | 1,500 - 2,000 | 15x - 20x | 音频 STT/TTS 转换 |\n| 长时音频流 | 500 | 10,000+ | 100x+ | 持续音频处理 |\n\n*注意:以上 Token 估算值为行业通用经验值,具体数值受采样率(24kHz/48kHz)和编码格式影响。建议通过 /billing-path 查看实际账单中的 Token 明细。*\n\n## 对比实验:相同交互任务下,Realtime API 与标准 Chat Completions 的账单差异\n\n当任务核心是文本处理时,Realtime API 毫无优势;当任务核心是实时语音交互时,Realtime API 是必要选择,但成本需重新评估。\n\n假设一个客服场景:每天处理 1,000 次语音咨询,每次平均交互时长 30 秒(含用户说话和助手回答)。\n\n1. 标准 Chat Completions (Web + 手动录音):\n * 用户需先录音上传,再发送文本。\n * 文本 Token 极少,但需额外调用 Whisper API 处理音频。\n * Whisper API 费用:约 $0.006 / 分钟。\n * 30秒语音 = 0.5分钟。\n * 总成本 = 1,000 * (Whisper费用 + 文本API费用)。\n\n2. Realtime API (原生语音流):\n * 直接传输音频流,模型内部处理 STT/TTS。\n * 30秒交互 ≈ 60秒音频总时长。\n * 等效 Token 数 ≈ 60 * 150 (平均) = 9,000 tokens。\n * 成本 = 9,000 * $0.000006 (输入) + 9,000 * $0.00002 (输出) ≈ $0.072 / 次。\n * 日成本 ≈ $72。\n\n结论:Realtime API 简化了开发链路,但其“音频即 Token”的计费模式使得纯语音交互的成本远高于“文本+独立Whisper”的方案。开发者应评估是否值得为实时性支付溢价。\n\n## 优化建议:如何通过减少不必要的音频处理降低按秒计费成本\n\n1. VAD (语音活动检测) 优化:在客户端实现严格的 VAD,仅在检测到用户说话时才发送音频数据,避免静音期的 Token 消耗。\n2. 缓存策略:对于重复性高的语音指令,使用 /api-transit 或应用层缓存,减少重复推理。\n3. 混合模式:非实时场景(如语音备忘录分析)使用 Whisper API + GPT-4o 文本,而非 Realtime API。\n4. 监控账单:利用 /billing-path 监控 Token 增长率,设置预算警报。\n\n## 风险与边界\n\n* 非法律意见:本文档基于 OpenAI 官方公开定价信息整理,不构成法律或财务建议。API 定价可能会随时调整,请以 OpenAI 官方价格页 为准。\n* 计费误差:音频 Token 转换为非线性关系,不同采样率、编码格式会导致 Token 计数差异。建议在生产环境前进行小规模基准测试。\n* 模型版本:Realtime API 模型版本迭代频繁,不同版本的 Token 单价和音频处理效率可能不同,请确保代码中指定正确的模型 ID。\n\n## 延伸阅读\n\n- OpenAI 官方 API 概览\n- 最新 API 价格明细\n- API 计费路径与账单分析\n- 更多计费精算指南\n\n## English summary\n\nThe OpenAI Realtime API introduces a dual-cost structure for voice interactions, where audio duration is converted into token equivalents rather than a flat per-second fee. This means that 1 second of audio can generate significantly more tokens than a few words of text, leading to higher costs compared to standard text-based Chat Completions. Developers must carefully audit their audio stream lengths and implement Voice Activity Detection (VAD) to minimize unnecessary token consumption. While Realtime API offers superior latency and ease of integration for voice apps, its token density for audio processing can make it more expensive than a hybrid approach using Whisper API and GPT-4o for text. Always monitor your /billing-path to track token usage spikes during long audio sessions.