
# Embeddings 计费与检索架构:别和 Chat 混账
OpenAI 的 Embeddings API 专为创建文本向量而设计,主要服务于检索增强生成(RAG)、语义搜索、分类和聚类等场景。它与 Chat 模型完全不同,不参与输出生成,仅按输入 token 计费,且价格远低于 GPT 系列。适用于 1M+ token 月级别的项目开发者和需要精确语义匹配的开发者。
核心概念与术语
- Embeddings(嵌入):将文本转换为固定维度的浮点数向量(如 1536 或 3072 维),向量距离越近表示语义越相似。
- Embedding API:OpenAI 专属接口(
POST /v1/embeddings),用于生成向量。 - Token 计费单位:仅输入 token(非输出),与 Chat 模型的
/v1/chat/completions完全独立。 - 模型类型:
- text-embedding-3-small:推荐首选,性价比高,MTEB 得分 62.3%。
- text-embedding-3-large:追求更高准确性,MTEB 得分 64.6%。
- text-embedding-ada-002:老一代模型,仍可使用但已过时。
决策表:Embeddings 何时与 Chat 模型混用
| 场景 | 推荐模型 | 是否混用 Chat | 原因与决策依据 |
|---|---|---|---|
| RAG 知识库检索 | text-embedding-3-small | 否 | 向量距离匹配最优,成本最低 |
| 语义搜索与分类 | text-embedding-3-small | 否 | 实时响应,输入量大时更经济 |
| 高精度聚类/推荐 | text-embedding-3-large | 否 | 准确率胜出,适合离线/批量处理 |
| ChatGPT Plus 订阅 | 无需 Embeddings | 是 | 仅聊天,Embeddings 另计费 |
| 混合应用(Chat + 检索) | Embeddings + Chat | 否 | 向量仅 Embeddings 计费,Chat 单独计费 |
决策原则:项目中使用向量检索时,必须选择 Embeddings API;如果同时调用 Chat 模型,价格完全独立,按实际 token 统计。
实操清单:分步可核对计费
1. 创建 API Key:进入 OpenAI 平台,生成并保存。
2. 选择模型:在请求中指定 model: "text-embedding-3-small"(或 large/ada)。
3. 构建请求:
{
"input": ["文本1", "文本2"], // 数组支持批量
"model": "text-embedding-3-small"
}
4. 调用 API:使用 curl、Python requests 或官方 SDK。
5. 检查计费:响应中 usage.prompt_tokens 即为计费 token;查看 OpenAI 计费页面 对照公式计算。
6. 批量优化:开启 Batch API 可减半价格($0.01/M for small)。
示例(per 1M tokens):
- text-embedding-3-small:$0.02(标准),Batch 后 $0.01
- text-embedding-3-large:$0.13(标准),Batch 后 $0.065
常见坑与风险边界
- 误以为 Chat 计费:Embeddings 没有输出 token,很多人把向量视为“生成结果”导致低估成本。
- 维度混淆:
text-embedding-3-large为 3072 维,small为 1536 维,影响存储和查询速度。 - Batch 延迟:24 小时返回,不适合实时应用。
- 价格变动:以 OpenAI 官方定价页 当日数据为准,历史模型已迁移至新版。
- 输入长度限制:单个请求最大约 300,000 tokens。
非法律意见声明:以上信息基于公开官方文档整理,仅供参考,不构成任何法律或专业咨询。实际计费以 OpenAI 平台实时数据为准,请自行核对 API 文档与计费页面。
站内路径:相关工具与页面
- 官方 API 入门指南:完整模型列表与快速上手
- OpenAI API 价格一览:实时定价对照表
- API 流量与计费监控:实时费用追踪与优化建议
- 计费核对全流程:账单拆解与 API 明细查询
- API 使用最佳实践指南:Embeddings 与 Chat 混合开发示例
English summary
Embeddings from OpenAI create vector representations of text for semantic search, RAG, and classification tasks. Unlike Chat models, the Embeddings API only charges for input tokens with no output billing. Pricing is dramatically lower than GPT models at scale, making it ideal for high-volume retrieval applications. The main models are text-embedding-3-small ($0.02/M, Batch $0.01/M) and text-embedding-3-large ($0.13/M, Batch $0.065/M). Developers must keep the two systems separate in their billing and code to avoid cost surprises. Official pricing pages provide the most accurate rates, and Batch API offers significant savings for non-real-time workloads. Always verify current costs directly on the OpenAI platform before production deployment.