官方API

Embeddings 计费与检索架构:别和 Chat 混账

OpenAI 品牌专题:Embeddings 计费与检索架构:别和 Chat 混账。 锚点:OpenAI。

가이드 목록 · 본문은 주로 중국어 간체입니다. 영문 요약(English summary)을 참고하세요.

封面:Embeddings 计费与检索架构:别和 Chat 混账

## OpenAI API 计费与检索架构:别和 Chat 混账

OpenAI 的 Embeddings API 专为语义检索、向量数据库索引和推荐系统设计,与 Chat Completions API 的文本生成场景完全不同。如果你正在为 RAG 系统、知识库搜索或文档相似度匹配支付账单,别再把 Embeddings 的 Token 费用当成 ChatGPT API 那样算。正确决策的关键是看你的查询类型和检索精度需求——小模型适用于海量数据,大模型适合高准确度业务。

## 核心概念与术语

OpenAI API 提供两类主要服务:

  • Chat Completions API:生成自然语言回复,适合对话和内容创作。使用 gpt-4o、o1 等模型。
  • Embeddings API:将文本转为向量表示,核心模型为 text-embedding-3-small(推荐入门)和 text-embedding-3-large(高端精度)。单位是 $/M tokens(每百万 Token 价格)。

检索架构通常流程是:先用 Embeddings API 把文档/查询转为向量,然后在向量数据库(如 Pinecone、Weaviate)中相似度匹配,最后用 Chat API 生成答案。Prompt 缓存主要作用于 Chat 模型,Embeddings 没有此特性。

## 决策表:OpenAI API 计费与检索场景对照

使用以下表格快速判断你的需求(数据基于 OpenAI 官方最新挂牌价格,以当日实际为准):

场景类型 推荐模型 主要费用($/M tokens) 适用场景 是否适合 ChatGPT Plus 订阅
通用文本生成、对话 gpt-4o / o1 输入 ~5.0 / 输出 ~15.0 内容创作、聊天机器人 部分支持(API 单独计费)
海量文档检索(RAG 入门) text-embedding-3-small 输入 0.02(批处理 0.01) 知识库索引、语义搜索 不支持(Embeddings 独立)
高精度法律/医疗检索 text-embedding-3-large 输入 0.13(批处理更低) 专业领域精确匹配 不支持
混合系统(检索+生成) Embeddings + Chat 0.02 + 5.0 / 15.0 推荐系统、智能客服 API 直连计费

表格说明:ChatGPT Plus 主要面向个人聊天,其订阅内不包含 Embeddings API 开销。OpenAI API 按实际 Token 消耗实时计费,无额外订阅门槛。

## 实操清单:分步可核对 OpenAI API 计费

1. 登录 OpenAI 官方 API 页面(或访问我们的对照站 /official-prices),找到 Embeddings 模型定价。

2. 选择模型:text-embedding-3-small 适合日常检索,text-embedding-3-large 适合需要更高维度准确度的场景。

3. 创建 API Key 并测试:用 curl 或官方 SDK 调用 /v1/embeddings 接口,记录单次输入 Token 数与费用。

4. 模拟检索流程:准备 1000 条文档,计算总 Token 量,预估每月账单。

5. 对比对比表(见上表),确认是否与 Chat Completions API 混淆。

6. 开启批量处理(Batch)降低费用:Embeddings 支持批量提交,成本可减半。

## 常见坑与风险边界

最常见风险是把 Embeddings API 当成 Chat API 计费,导致账单意外上涨 5-10 倍。另一个是忽略缓存仅限于 Chat 模型,Embeddings 每次请求都按全量 Token 收费。风险边界:如果你的应用对检索精度要求极高(金融风控、医疗诊断),必须用 text-embedding-3-large,否则小模型已足够 80% 场景。批量处理是降低费用的唯一官方途径,非官方修改器或解锁工具会带来风险。

## 风险与边界

以上内容仅供参考,非法律意见。OpenAI API 价格可能随时调整,请以官方文档为准。使用非官方账号切换或本地 GPU 方案将导致对不上账单、无法升级 OpenAI 旗舰模型,甚至账号被限流。建议始终通过官方渠道验证计费,避免任何绕过支付或注入行为。

## 站内路径:相关工具与页面

## 延伸阅读

## English summary

OpenAI Embeddings API handles semantic search and vector embeddings separately from the Chat Completions API for text generation. This distinction is critical for accurate billing and cost optimization in retrieval-augmented generation (RAG) systems. The decision to use Embeddings or Chat models depends on your query type and required retrieval precision. Use text-embedding-3-small for most RAG applications at $0.02 per million tokens, reserving text-embedding-3-large for high-accuracy needs. Prompt caching applies only to Chat models, not Embeddings. Always verify current pricing directly on the official OpenAI site, as it can change. This guide helps developers reconcile bills and avoid common mix-ups between embedding costs and ChatGPT Plus subscriptions. For professional setups, direct API usage ensures full control over OpenAI API计费.