计费

图片/音频计费坑:别只看文本 $/M

多模态按块/秒/token 另计,账单容易超预期。

All guides · Full article is primarily Simplified Chinese; use the English summary below for quick takeaways (GEO-friendly).

图片/音频计费坑:别只看文本 $/M

多模态模型的计费远不止文本部分的 $/M(每百万 Token)。图像按 tile(瓦片)patch(补丁) 折算额外 Token,音频按秒或分钟独立计费,Realtime API 则同时收取输入音频、输出音频和文本费用。许多开发者只盯着文本输入输出价格压测,结果账单远超预期。

谁适用:使用 GPT-4o、GPT-4o-mini、Realtime 模型、Whisper 转录或 TTS 的个人开发者、创业团队,以及依赖中转(transit)服务的用户。怎么决策:先读官方价表备注,确认 image tile / audio per-second 规则,再用小流量真实压测,最后选择合适的缓存策略和分辨率控制,才能把成本控制在预期内。

为什么只看文本 $/M 会踩坑

OpenAI 官方价表通常以 text input/output $/M 为主,但多模态部分有单独计量方式。图像不会简单按像素收费,而是先 resize 再切成固定大小的 tile,每个 tile 对应固定 Token 数。高分辨率图片可能产生数百甚至上千额外 Token,直接拉高 prompt_tokens。

音频更明显:Whisper 转录按音频时长(分钟)计费,Realtime API(如 gpt-realtime-2.1)则按输入音频秒、输出音频秒和文本 Token 三部分分别收费。很多中转平台会在官方价格上叠加 多模体系数(1.2x~2x 不等),如果不仔细对账,账单很容易翻倍。

核心建议:始终优先阅读官方价表最下方的备注和 FAQ,再用小批量真实数据(而非模拟文本)进行压测。不要只依赖第三方计算器,要以 API 返回的 usage 对象为准,尤其是 input_tokens_details.image_tokens 和音频相关字段。

图像(Vision)计费机制详解

当前主流视觉模型(如 GPT-4o 系列)采用 tile-basedpatch-based 方式计算图像 Token:

  • Low detail:通常固定 85~170 Token(视模型而定),适合不需要精细细节的场景。
  • High detail:先将图像缩放至最长边不超过 2048px,最短边不超过 768px,然后按 512px 方块切 tile,每个 tile 收取固定 Token(GPT-4o 系列常见 170 Token/base + per tile)。
  • 公式简化为:tokens ≈ base + (tiles × multiplier),具体 multiplier 随模型更新而变化。

实际压测中,同一张 1024×1024 图片在 low 和 high detail 下 Token 消耗可能相差 3~5 倍。超大图(如 4K 截图)很容易产生 500+ 额外 Token,一次对话含 5~10 张图时,图像成本就可能超过文本。

常见坑

  • 忘记设置 detail: "low",默认 high detail 导致费用激增。
  • 批量处理未压缩图片,未提前 resize。
  • 只看 prompt_tokens 总数,未拆分 image_tokens 单独核算。

以下是典型模型图像计费参考表格(数据来源于官方文档与社区实测,实际以 API 返回为准):

模型 模式 典型单图 Token 范围 计费特点 建议场景
GPT-4o low detail 85 ~ 170 固定基数,低消耗 简单描述、OCR
GPT-4o high detail 300 ~ 800+ tile 动态计算 复杂图表、截图分析
GPT-4o-mini high detail 更高 multiplier 比 4o 更贵 per tile 成本敏感但需视觉
Realtime 系列 Image input 按 tile + 文本 与音频同时计费 实时多模态对话

(表格列数控制在 5 以内,移动端可横向滚动查看。)

音频与 Realtime 计费特点

音频计费完全独立于文本 Token:

  • Whisper 转录:主要按音频时长(分钟)收费,长音频成本线性上升。支持提示词优化准确率,但不影响价格。
  • TTS(Text-to-Speech):部分模型按字符数,部分按生成音频时长计费。
  • Realtime API(gpt-realtime-2.1 等):同时收取 Input AudioOutput AudioText 三部分费用。输入音频按秒,输出音频按秒,文本仍按 $/M。缓存(cached input)可显著降低重复对话成本,但音频部分缓存效果有限。

中转平台常在此基础上增加 多媒体系数 或单独音频通道费用。如果你的应用大量使用语音输入输出,账单结构会与纯文本项目完全不同。建议在 /billing-path 中查看历史账单时,按 modality 筛选查看 audio_tokens 或时长明细。

压测 checklist

  • 是否在请求中明确设置图像 detail 参数?
  • 是否记录 API 返回的 usage.input_tokens_details 对象?
  • 中转商是否在价表外额外收取 vision/audio 系数?(参考 /api-transit
  • 小流量测试时,是否用真实图片和音频文件而非占位符?

中转平台与官方 API 的差异

直接使用官方 API(详见 /official-api)能获得最透明的计费,但需要自行管理 Key 和速率限制。许多用户选择中转服务以获得更高限额和统一账单,此时必须确认中转是否“透明传递”官方多模态价格,还是叠加了固定系数。

推荐做法:

1. 先在官方价表(/official-prices)读懂基础规则。

2. 选择中转后,用少量预算跑真实多模态任务。

3. 定期对账,使用类似外部工具辅助核对(例如独立参考站提供的账单对账工具)。

如何有效控制多模态成本

  • 图像优化:优先使用 low detail;批量处理前统一 resize 到 512~1024px 范围;必要时用描述性文本替代部分图片。
  • 音频优化:缩短单次录音时长;重复内容利用缓存机制;非实时场景优先用批量转录而非 Realtime。
  • 监控与预警:在代码中捕获 usage 对象,设置成本阈值报警;每月复盘账单,重点看图像和音频占比。
  • 模型选择:成本敏感场景优先 GPT-4o-mini(注意其 vision tile multiplier 可能更高);复杂视觉任务再切换主模型。

这些实践能将多模态超支风险降低 50% 以上,但前提是先读备注,再压测

风险与边界

本文所有内容基于公开文档与社区实测数据整理,仅供参考,帮助用户更好地理解和规划 API 使用成本。不构成任何财务、法律或投资建议。OpenAI 官方定价可能随时调整,实际账单以平台后台显示为准。中转服务费用因供应商而异,请自行核实最新条款。作者及本站不对因使用本文信息导致的任何经济损失承担责任。请始终以官方最新文档为最终依据。

延伸阅读

外部独立参考(仅作技术对账辅助):

  • https://www.grokcode.cn/tools/token-cost
  • https://www.grokcode.cn/tools/bill-reconcile

---

Site-vertical guide · OpenAICN 官方价