Token 与下一个 Token 预测

建议用时:25 分钟(含练习)

学习目标

能够解释文本如何被切成 Token,以及模型为何是逐步生成而非查找标准答案。

本节产出

一张从文本到输出的生成流程图

核心知识:模型看到的不是一页纸

术语

Token

你输入“请把这段话写得更清楚”,界面显示的是汉字,模型内部处理的却是一串编码。Tokenizer(分词器)先把文本转换成 Token,再映射为词表中的编号。一个 Token 可能对应一个字、一个词的一部分、标点、空格或其他片段,具体取决于分词器。不要把 Token 直接等同于汉字数,也不要把“英文一个单词大约多少 Token”当成所有语言和模型的固定公式。

这里可以借用积木来理解:同一句话可以由不同大小的积木拼成,不同词表规定了不同的拼法。但模型使用的不只是离散编号,还会将它们转换为向量表示,再经过网络计算。积木比喻只帮助理解切分,不代表模型在搬运现成句子,更不代表它在数据库里查找唯一答案。

对自回归文本生成而言,一个基本过程是:根据目前可见的上下文,计算下一个 Token 的候选分布,按解码策略选择一个,再把它接到已有序列后面,继续计算。这里的“预测”不是预知未来,而是条件概率计算。模型训练后还可能经过指令训练等阶段;完整产品也可以加入工具、搜索和验证,所以“下一个 Token”描述的是生成机制的重要部分,不是整个产品能力的全部说明。

文本先被分词成 Token 编号,模型计算下一项候选分布,选择结果后追加到上下文并继续生成

看图时注意反馈箭头:已生成的内容会影响后面的内容。如果早期把任务理解错了,后面可能沿着错误方向写出一篇非常连贯的文章。因此,长输出不能只在最后检查格式;在关键选择点先确认结构、数据和约束,往往比写完再全部推翻更省时间。

一个不需要代码的概率例子

假设某个教学用模型看到“这杯茶太烫了,请先”,给出下列下一片段候选。这里的片段和概率只是示意,不对应任何真实模型的分词或输出。

候选片段示例概率接上后可能的发展
放凉0.55放凉后再喝
等0.25等一会儿
加0.15加一点冷水
其他0.05其他续写方向

选择最高概率候选是一种策略,按分布抽样是另一种策略。温度等参数可以影响选择的分散程度,但不能给错误事实加上真实性保证。低温度也不等于数据库查询,输出仍可能错误;不同服务对参数的支持范围和含义需要查看各自文档,不能假设所有模型都接受同一组选项。

Token 为什么与预算和长度有关

模型服务通常会对输入和输出设定长度或用量边界。一次请求的输入可能不只有用户最后一句话,还包括历史消息、系统指令、工具定义和检索材料。某些模型还存在额外的推理用量计算规则。最稳妥的做法是查看当前服务的实际用量字段和文档,而不是只数聊天窗口里自己打了几个字。

可以用一个简化教学账本理解:输入材料为 1,200 Token,输出上限为 800 Token,假定此练习中的总预算为 2,000 Token,那么已经没有空间再加入另一份 600 Token 的附件。现实服务未必使用这样的统一预算公式,本例只是说明上下文和输出都会占用资源。实际可用窗口、输出上限和计费方式需要分别确认。

案例:为什么“压缩成一段”不一定省得最多

你有一份活动安排,包含时间、地点、报名条件和三页历史说明。任务只要求生成一条报名提醒。把全部材料压缩成一个没有换行的长段落,字符数几乎没变,关键信息反而更难检查。更好的处理是保留必要字段,去掉无关历史,并明确“缺失字段不要补写”。

如果要验证节省效果,可以使用与目标模型匹配的官方计数工具,比较完整材料和筛选材料的 Token 数。不要把真实密钥或隐私材料粘贴到不可信的在线计数网站。没有合适工具时,先比较材料相关性和实际输出质量,也比凭经验宣称“减少了百分之八十 Token”可靠。

动手练习

  1. 准备四段无敏感信息的文本:短中文、短英文、一个网址和一小段 JSON。用同一可信分词器观察切分,记录哪些边界出乎你的预期。
  2. 为“生成报名提醒”制作完整材料和精选材料两版。确保精选版仍保留活动日期、地点、报名方式及限制条件。
  3. 用同一输出要求比较两版结果,检查有没有遗漏关键字段。没有模型调用条件时,可以手工检查输入是否足以支持目标输出。

参考答案与推演

完成检查

  • 能解释 Token 与字符、单词不是固定的一一对应关系。
  • 能复述“计算分布—选择—追加—继续”的过程及其局限。
  • 不把低温度当作真实性保证,不编造计数或节省比例。
  • 精选材料保留了完成任务必需的全部字段。

参考与来源

Token 与下一个 Token 预测

3 道题 · 及格分 60 分

开始测验