544 字
3 分钟
模型、参数与上下文窗口
模型、参数与上下文窗口
学习大模型时,经常会看到“模型参数”“上下文窗口”“长上下文”等词。它们都和模型能力有关,但不是一回事。
模型是什么
模型可以理解为一套经过训练的参数和推理程序。你输入文本,模型根据训练中学到的语言规律和当前上下文,预测并生成后续内容。
不同模型的差异来自很多方面:
- 训练数据。
- 参数规模。
- 训练方法。
- 对齐方式。
- 上下文长度。
- 工具调用和多模态能力。
- 推理成本和响应速度。
参数是什么
参数是模型内部用于表达知识和模式的数值。参数越多,模型通常有更强的表达能力,但不代表一定更适合所有任务。
选模型时不要只看参数规模,还要看:
- 中文能力。
- 代码能力。
- 推理能力。
- 多模态能力。
- 成本。
- 速度。
- API 稳定性。
上下文窗口是什么
上下文窗口是模型一次请求中能看到的最大信息量,包括系统提示、用户输入、历史对话、检索资料、工具结果和模型输出。
上下文窗口越大,模型能接收的材料越多,但也会带来:
- 成本增加。
- 响应变慢。
- 关键信息被稀释。
- 长文本中间内容被忽略的风险。
初学者怎么理解
可以把模型调用想象成一次开卷答题:
- 参数:模型脑子里原本学过的东西。
- 上下文窗口:这次考试允许带进考场的资料。
- Prompt:你给模型的答题要求。
- 输出:模型根据“已有能力 + 当前资料”写出的答案。
最小练习
拿一篇长文章,让模型分别完成两次任务:
请总结这篇文章。再试:
请只总结这篇文章中和“成本控制”有关的内容,并输出 3 条要点。比较两次结果。你会看到,模型不是只靠材料长度工作,而是很依赖任务边界。