435 字
2 分钟
token 与成本

token 与成本#

Token 是模型处理文本的基本单位。大模型 API 通常按 token 计费,所以理解 token 是控制成本的第一步。

token 不是字数#

Token 不完全等于一个汉字,也不完全等于一个英文单词。它是模型 tokenizer 切分文本后的片段。

你只需要先记住:

  • 输入会消耗 token。
  • 输出也会消耗 token。
  • 上下文越长,成本越高。
  • 模型越强,通常单价越高。

成本由什么决定#

一次调用的成本通常由三部分决定:

因素说明
输入 token你发给模型的提示词、资料、历史对话
输出 token模型生成的回答
模型单价不同模型价格不同

RAG 和 Agent 场景中,成本还会受到检索片段数量、工具结果长度、多轮调用次数影响。

常见成本失控场景#

  • 把完整文档塞给模型,而不是先检索相关片段。
  • 多轮对话一直保留全部历史。
  • Agent 循环调用工具,没有最大步数。
  • 要求模型生成很长内容,但没有限制输出长度。
  • Prompt 中有大量重复规则。

成本控制方法#

  1. 精简系统提示词。
  2. 长文档先切块,再检索。
  3. 多轮对话定期摘要。
  4. 给输出设定长度和格式。
  5. 为 Agent 设置最大步骤。
  6. 简单任务使用更便宜的模型。

最小练习#

打开本站实验室的 Token 成本估算器,分别输入:

请解释 RAG。

和:

请基于以下 5000 字文档解释 RAG,并输出完整教程。
{长文档}

观察成本差异。你会更直观地理解为什么应用开发需要控制上下文。

token 与成本
https://llmhello.com/posts/2026_07/token-and-cost/
作者
Happy Zhuang
发布于
2026-07-03
许可协议
CC BY-NC-SA 4.0