Token(词元)是大语言模型处理文本的基本单位。模型不会直接读「一整段文字」,而是先把文本切分成一个个 Token,再把这些 Token 映射为向量进行计算。
一个 Token 并不等于一个字或一个词:
- 英文里,常见单词通常是一个 Token(如 "hello"),但长单词可能被拆成多个子词 Token。
- 中文里,一个汉字可能是 1~2 个 Token,具体取决于模型的分词器。
- 标点、空格、数字也会占用 Token。
不同模型的 Token 切分方式不同,所以「同样一句话消耗多少 Token」在不同模型间并不相同。
Token 是理解大模型能力与成本的钥匙:
- 上下文窗口以 Token 计。模型单次能处理的输入+输出总量(如 8K、32K、128K Token)决定它能「记住」多长的对话或文档。超出窗口的内容会被截断或忽略。
- 计费以 Token 计。大多数模型按「输入 Token + 输出 Token」收费,长文档、长输出直接决定调用成本。
- 性能与速度受影响。单次处理的 Token 越多,推理耗时与显存占用通常越高。
- 控制提示词长度:把「上下文窗口」留给关键信息。无关的背景、重复的指令都会消耗 Token 且可能稀释模型注意力。
- 估算成本:中文约 1000 字 ≈ 1000~2000 Token(因模型而异),调用前先估算,避免账单惊吓。
- 分段处理长文档:文档超窗时,拆成片段分别处理,再汇总结果,比硬塞进一个窗口效果更好。
- 注意输出长度:要求模型输出结构化、限定长度的内容,可以显著降低输出 Token 消耗。
- 「Token 等于字数」:不准确。中英文、不同分词器下 Token 与字数的比例都不同。
- 「窗口越大越好」:大窗口方便,但也会稀释注意力、增加成本。按任务需要选合适的模型档位即可。
- 「计费只看输出」:输入同样计费,长系统提示词会持续产生成本。
Token 是理解大语言模型「能力边界」和「使用成本」的基本单位:它决定上下文窗口、决定计费、影响生成质量。写提示词、选模型、估算成本时,都值得先用 Token 的视角过一遍。具体分词与计费规则以各模型官方文档为准。