435 字
2 分钟
token 与成本
token 与成本
Token 是模型处理文本的基本单位。大模型 API 通常按 token 计费,所以理解 token 是控制成本的第一步。
token 不是字数
Token 不完全等于一个汉字,也不完全等于一个英文单词。它是模型 tokenizer 切分文本后的片段。
你只需要先记住:
- 输入会消耗 token。
- 输出也会消耗 token。
- 上下文越长,成本越高。
- 模型越强,通常单价越高。
成本由什么决定
一次调用的成本通常由三部分决定:
| 因素 | 说明 |
|---|---|
| 输入 token | 你发给模型的提示词、资料、历史对话 |
| 输出 token | 模型生成的回答 |
| 模型单价 | 不同模型价格不同 |
RAG 和 Agent 场景中,成本还会受到检索片段数量、工具结果长度、多轮调用次数影响。
常见成本失控场景
- 把完整文档塞给模型,而不是先检索相关片段。
- 多轮对话一直保留全部历史。
- Agent 循环调用工具,没有最大步数。
- 要求模型生成很长内容,但没有限制输出长度。
- Prompt 中有大量重复规则。
成本控制方法
- 精简系统提示词。
- 长文档先切块,再检索。
- 多轮对话定期摘要。
- 给输出设定长度和格式。
- 为 Agent 设置最大步骤。
- 简单任务使用更便宜的模型。
最小练习
打开本站实验室的 Token 成本估算器,分别输入:
请解释 RAG。和:
请基于以下 5000 字文档解释 RAG,并输出完整教程。{长文档}观察成本差异。你会更直观地理解为什么应用开发需要控制上下文。