图片/音频计费坑:别只看文本 $/M
多模态模型的计费远不止文本部分的 $/M(每百万 Token)。图像按 tile(瓦片) 或 patch(补丁) 折算额外 Token,音频按秒或分钟独立计费,Realtime API 则同时收取输入音频、输出音频和文本费用。许多开发者只盯着文本输入输出价格压测,结果账单远超预期。
谁适用:使用 GPT-4o、GPT-4o-mini、Realtime 模型、Whisper 转录或 TTS 的个人开发者、创业团队,以及依赖中转(transit)服务的用户。怎么决策:先读官方价表备注,确认 image tile / audio per-second 规则,再用小流量真实压测,最后选择合适的缓存策略和分辨率控制,才能把成本控制在预期内。
为什么只看文本 $/M 会踩坑
OpenAI 官方价表通常以 text input/output $/M 为主,但多模态部分有单独计量方式。图像不会简单按像素收费,而是先 resize 再切成固定大小的 tile,每个 tile 对应固定 Token 数。高分辨率图片可能产生数百甚至上千额外 Token,直接拉高 prompt_tokens。
音频更明显:Whisper 转录按音频时长(分钟)计费,Realtime API(如 gpt-realtime-2.1)则按输入音频秒、输出音频秒和文本 Token 三部分分别收费。很多中转平台会在官方价格上叠加 多模体系数(1.2x~2x 不等),如果不仔细对账,账单很容易翻倍。
核心建议:始终优先阅读官方价表最下方的备注和 FAQ,再用小批量真实数据(而非模拟文本)进行压测。不要只依赖第三方计算器,要以 API 返回的 usage 对象为准,尤其是 input_tokens_details.image_tokens 和音频相关字段。
图像(Vision)计费机制详解
当前主流视觉模型(如 GPT-4o 系列)采用 tile-based 或 patch-based 方式计算图像 Token:
- Low detail:通常固定 85~170 Token(视模型而定),适合不需要精细细节的场景。
- High detail:先将图像缩放至最长边不超过 2048px,最短边不超过 768px,然后按 512px 方块切 tile,每个 tile 收取固定 Token(GPT-4o 系列常见 170 Token/base + per tile)。
- 公式简化为:tokens ≈ base + (tiles × multiplier),具体 multiplier 随模型更新而变化。
实际压测中,同一张 1024×1024 图片在 low 和 high detail 下 Token 消耗可能相差 3~5 倍。超大图(如 4K 截图)很容易产生 500+ 额外 Token,一次对话含 5~10 张图时,图像成本就可能超过文本。
常见坑:
- 忘记设置
detail: "low",默认 high detail 导致费用激增。 - 批量处理未压缩图片,未提前 resize。
- 只看
prompt_tokens总数,未拆分image_tokens单独核算。
以下是典型模型图像计费参考表格(数据来源于官方文档与社区实测,实际以 API 返回为准):
| 模型 | 模式 | 典型单图 Token 范围 | 计费特点 | 建议场景 |
|---|---|---|---|---|
| GPT-4o | low detail | 85 ~ 170 | 固定基数,低消耗 | 简单描述、OCR |
| GPT-4o | high detail | 300 ~ 800+ | tile 动态计算 | 复杂图表、截图分析 |
| GPT-4o-mini | high detail | 更高 multiplier | 比 4o 更贵 per tile | 成本敏感但需视觉 |
| Realtime 系列 | Image input | 按 tile + 文本 | 与音频同时计费 | 实时多模态对话 |
(表格列数控制在 5 以内,移动端可横向滚动查看。)
音频与 Realtime 计费特点
音频计费完全独立于文本 Token:
- Whisper 转录:主要按音频时长(分钟)收费,长音频成本线性上升。支持提示词优化准确率,但不影响价格。
- TTS(Text-to-Speech):部分模型按字符数,部分按生成音频时长计费。
- Realtime API(gpt-realtime-2.1 等):同时收取 Input Audio、Output Audio 和 Text 三部分费用。输入音频按秒,输出音频按秒,文本仍按 $/M。缓存(cached input)可显著降低重复对话成本,但音频部分缓存效果有限。
中转平台常在此基础上增加 多媒体系数 或单独音频通道费用。如果你的应用大量使用语音输入输出,账单结构会与纯文本项目完全不同。建议在 /billing-path 中查看历史账单时,按 modality 筛选查看 audio_tokens 或时长明细。
压测 checklist:
- 是否在请求中明确设置图像
detail参数? - 是否记录 API 返回的
usage.input_tokens_details对象? - 中转商是否在价表外额外收取 vision/audio 系数?(参考
/api-transit) - 小流量测试时,是否用真实图片和音频文件而非占位符?
中转平台与官方 API 的差异
直接使用官方 API(详见 /official-api)能获得最透明的计费,但需要自行管理 Key 和速率限制。许多用户选择中转服务以获得更高限额和统一账单,此时必须确认中转是否“透明传递”官方多模态价格,还是叠加了固定系数。
推荐做法:
1. 先在官方价表(/official-prices)读懂基础规则。
2. 选择中转后,用少量预算跑真实多模态任务。
3. 定期对账,使用类似外部工具辅助核对(例如独立参考站提供的账单对账工具)。
如何有效控制多模态成本
- 图像优化:优先使用 low detail;批量处理前统一 resize 到 512~1024px 范围;必要时用描述性文本替代部分图片。
- 音频优化:缩短单次录音时长;重复内容利用缓存机制;非实时场景优先用批量转录而非 Realtime。
- 监控与预警:在代码中捕获
usage对象,设置成本阈值报警;每月复盘账单,重点看图像和音频占比。 - 模型选择:成本敏感场景优先 GPT-4o-mini(注意其 vision tile multiplier 可能更高);复杂视觉任务再切换主模型。
这些实践能将多模态超支风险降低 50% 以上,但前提是先读备注,再压测。
风险与边界
本文所有内容基于公开文档与社区实测数据整理,仅供参考,帮助用户更好地理解和规划 API 使用成本。不构成任何财务、法律或投资建议。OpenAI 官方定价可能随时调整,实际账单以平台后台显示为准。中转服务费用因供应商而异,请自行核实最新条款。作者及本站不对因使用本文信息导致的任何经济损失承担责任。请始终以官方最新文档为最终依据。
延伸阅读
外部独立参考(仅作技术对账辅助):
- https://www.grokcode.cn/tools/token-cost
- https://www.grokcode.cn/tools/bill-reconcile
---
本サイト専用ガイド · OpenAICN 官方价