大语言模型与生成式 AI入门已核验核验于 2026-09-19

Token

Token (别名:词元、文本令牌)

模型读写文本的最小计量单位——是切分与计费的单位,不等于一个字,也不等于一个词。

本页目录
快速跳转

它是什么

Token 是模型读写文本时的最小计量单位。分词器先把原始文本切成片段,再把这些片段映射成整数编号——模型实际吃的是一串编号,不是字符串。

它是一个切分与计费的单位:不是一个字,不是一个词,也不是一个「意思」。同一个汉字可能独占一个 Token,也可能和相邻字符并成一个;英文单词可能被拆成好几段。所以「这段话有多少 Token」这句话,离开具体模型是没有答案的。

为什么需要它

神经网络没法直接算任意长度的文本,必须有有限的输入空间;Token 就是那层「先离散化再映射」的桥。这是它存在的最初理由。

但对做产品的人来说,更实际的理由是它是三件事的共同计量单位:上下文占用、生成延迟、以及按量计费的成本。这也是为什么「这段提示词有多长」不能靠数字数来回答——字符数只能当粗略估计,中英混排时误差可以很大。

它如何工作

链路是这样的:

文本 → 分词器 → 整数 ID → 查表成向量 → 加上位置信息 → 逐层注意力计算 → 输出下一个 Token 的概率分布 → 解码器把 ID 还原成文本。

三个机制细节值得知道:

  • 词表是训练前定好的超参。 分词算法(常见的是子词切分,如 BPE 一类做法)在训练时从语料里学出一张固定词表,之后一直用它——所以「模型 A 的 Token」和「模型 B 的 Token」不是一个东西。
  • 切分是可逆的。 编码出来的 ID 序列能被解码回原文,这正是「模型输出一串编号、你看到一段话」能成立的前提。
  • 生成是逐个 Token 进行的。 这也是为什么输出长度直接换算成时间与费用的原因。

必须澄清的误会

Token ≠ 字 / 词。 这是最普遍的一条。「一个汉字约等于 1.5 个 Token」「一个英文单词约等于 1.3 个 Token」这类换算系数只是经验值,用来做量级估算可以,用来卡预算、设截断阈值就会出事。真正可靠的做法只有一个:用目标模型的官方计数器量。

Token ≠ Tokenizer。 前者是切出来的单位,后者是切它的工具。这条区分在排查问题时很重要——你发现「同一个词占的 Token 数变了」,那是分词器或模型换了,而不是「Token 这个概念变了」。

Token 数 ≠ 成本的全部。 输入和输出通常分别计价,而输出往往更贵。做预算时只看输入长度会低估。

真实例子

AI-Native 很好 这一串,在常见分词器下会被拆成好几段:AI 与 - 与 Native 各自成段,很 和 好 也可能是两段——中间那个空格有时还会并进相邻片段。

同一句话,换成另一个模型的分词器,切分点和总数都可能不一样。这就是为什么**「照字符数截断」是一个静默失效的做法**:你以为截到 4000 字是安全的,实际 Token 数可能刚好把系统指令挤出窗口。

什么时候适合与不适合

适合:一切要按长度设预算的地方——上下文裁剪阈值、批处理的单条上限、成本估算、以及「这句话要不要先摘要再送进去」的判断。

不适合:拿它衡量「内容有多少信息」。两个 Token 数相同的段落,一个可能是三个关键词,另一个可能是一整段被拆碎的废话。信息量、语义完整度和 Token 数之间没有稳定关系,用后者代替前者是常见的错觉。

还有一条工程上的取舍:词表越大,常见词越可能整词成段(序列更短),但词表本身的参数与稀疏性代价也更高。 这是分词器设计方的权衡,不是你能调的东西——你只能在自己的场景里量。

亲自试一下

拿一段你自己的中英混合文本——最好带上数字和代码,因为这两类最容易和直觉不一致——用目标模型官方的 tokenizer 工具数一遍。

然后只改一处:加一个空格、或把半角标点换成全角,再数一次。

全程约 10 分钟。观察点是「同一个意思的 Token 数为什么会变」——看到的差异就是「字符数不等于 Token 数」的直接证据。做完这一步,你以后就不会再用「大概多少字」来估上下文了。

接下来学什么

Token 是第 1 站 地基 · 模型是什么 的计量单位,本站回答的是「它为什么不是检索,又为什么必然会编」。

顺着本站走:先看 大语言模型(Token 是怎么进入模型的)与 上下文窗口(一次能装多少格),再看 幻觉(为什么「流畅」不等于「真实」)。

再往前一站是 沟通 · 怎么把需求说清楚:你省下来的每一个 Token,都决定了这一站能多带多少约束。

来源与修订

子词分词与「可逆编码」的机制参考 SentencePiece 论文(arXiv 1808.06226);Token 作为序列单位进入模型、由注意力机制处理序列的背景参考 Attention Is All You Need(arXiv 1706.03762)。两篇都是这个概念的原始来源,不是相邻主题的二手转述。

一处必须点明的边界:本文不给出任何 Token 换算系数——「一个汉字约等于几个 Token」这类数字依赖具体分词器与语言分布,写死在词条里只会变成过期经验。计数一律以目标模型官方分词器为准。

修订日期 2026-09-19:本条由生成模板改为决策页——补「必须澄清的误会」一节,去掉生成期的引用标记,补 boundaries 与 minAction。分词算法与词表规模都在演进,若目标模型更换分词器,应重核本文的机制描述(三条机制细节部分)。

Learning navigation

学习导航

沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

Token的一层关系

3 个节点 · 3 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Related names

相关名词

下面这些名字与「Token」讲的是同一块知识,内容已并入本页, 不再单独作为入口出现。保留链接是为了让旧地址仍然能打开。

  • 分词器Tokenizer

    与同域词条「Token」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。

  • 下一词元预测Next-Token Prediction

    与同域词条「Token」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。

Source register

核验来源

  1. SentencePiece - A simple and language independent subword tokenizer and detokenizer for Neural Text ProcessingarXiv · 访问于 2026-09-19
  2. Attention Is All You NeedarXiv · 访问于 2026-09-19

发布 2026-07-29 · 更新 2026-09-19 · 核验 2026-09-19