大语言模型与生成式 AI进阶已弃用核验于 2026-07-29

分词器

Tokenizer

按既定词表和规则把文本转换为 Token 序列,并在输出阶段完成反向解码的组件。

本页目录
快速跳转

它是什么

分词器是模型文本接口的一部分:它按固定规则和词表把文本切分并编码为 Token ID 序列,在输出阶段再把 Token 序列解码成文本。Token 可以是完整词、子词、字符或特殊标记,不等同于自然语言中的“一个词”。[S1][S2]

为什么需要它

模型只能处理有限编号集合,但真实文本中的名称、拼写和新词不断变化。子词分词在“每个完整词一个编号”和“每个字符一个编号”之间取得折中,让有限词表仍能组合出罕见或未见词形。[S2] 分词结果还会直接影响上下文长度、计算量和文本边界。

它如何工作

分词器通常先按既定方式规范化文本,再依据训练出的子词模型选择片段,并把每个片段映射到词表 ID。SentencePiece 可以直接从原始句子训练子词模型,不要求先按空格预分词。[S1] 解码则根据同一词表与规则还原文本;规范化和特殊 Token 的处理必须与模型训练时一致。

真实例子

“AI-Native 2026”可能被某个分词器切成“AI”“-”“Native”“2026”,也可能拆得更细。另一套词表可能得到完全不同的 Token 数量。产品若按字符数估算上下文或费用,就可能低估真实输入长度;正确做法是使用目标模型对应的分词器测量。

什么时候适合与不适合

子词分词适合开放词汇和多语言文本,有限词表也能覆盖新组合。代价是可读的一个词可能变成多个 Token,不同语言和写法的切分效率也可能不同。分词器与模型参数共同训练和使用,不能只替换词表而假设模型仍能理解原有 ID;Token 数也不能直接当作语义复杂度。

亲自试一下

目标是发现字符数与 Token 数不是同一尺度。选择一句中文、一句英文和一个包含数字与符号的产品名,分别用目标模型官方分词器查看切分与数量。记录哪段文本的“字符数/Token 数”差异最大,并说明这会如何影响上下文预算;不要用另一模型的结果代替。

接下来学什么

先阅读Token理解模型处理的基本单位,再用上下文窗口理解数量上限;随后学习Embedding观察 Token ID 如何变成向量表示,并回到大语言模型串联输入与生成过程。

来源与修订

从原始文本训练、编码与解码子词序列的机制参考 SentencePiece 论文 [S1];有限词表用子词组合处理罕见词的动机参考 BPE 子词论文 [S2]。本文不承诺任何字符串在不同模型中具有相同切分或 Token 数量。

Learning navigation

学习导航

同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。

Source register

核验来源

  1. SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text ProcessingarXiv · 访问于 2026-07-29
  2. Neural Machine Translation of Rare Words with Subword UnitsarXiv · 访问于 2026-07-29

发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29