它是什么
分词器是模型文本接口的一部分:它按固定规则和词表把文本切分并编码为 Token ID 序列,在输出阶段再把 Token 序列解码成文本。Token 可以是完整词、子词、字符或特殊标记,不等同于自然语言中的“一个词”。[S1][S2]
为什么需要它
模型只能处理有限编号集合,但真实文本中的名称、拼写和新词不断变化。子词分词在“每个完整词一个编号”和“每个字符一个编号”之间取得折中,让有限词表仍能组合出罕见或未见词形。[S2] 分词结果还会直接影响上下文长度、计算量和文本边界。
它如何工作
分词器通常先按既定方式规范化文本,再依据训练出的子词模型选择片段,并把每个片段映射到词表 ID。SentencePiece 可以直接从原始句子训练子词模型,不要求先按空格预分词。[S1] 解码则根据同一词表与规则还原文本;规范化和特殊 Token 的处理必须与模型训练时一致。
真实例子
“AI-Native 2026”可能被某个分词器切成“AI”“-”“Native”“2026”,也可能拆得更细。另一套词表可能得到完全不同的 Token 数量。产品若按字符数估算上下文或费用,就可能低估真实输入长度;正确做法是使用目标模型对应的分词器测量。
什么时候适合与不适合
子词分词适合开放词汇和多语言文本,有限词表也能覆盖新组合。代价是可读的一个词可能变成多个 Token,不同语言和写法的切分效率也可能不同。分词器与模型参数共同训练和使用,不能只替换词表而假设模型仍能理解原有 ID;Token 数也不能直接当作语义复杂度。
亲自试一下
目标是发现字符数与 Token 数不是同一尺度。选择一句中文、一句英文和一个包含数字与符号的产品名,分别用目标模型官方分词器查看切分与数量。记录哪段文本的“字符数/Token 数”差异最大,并说明这会如何影响上下文预算;不要用另一模型的结果代替。
接下来学什么
先阅读Token理解模型处理的基本单位,再用上下文窗口理解数量上限;随后学习Embedding观察 Token ID 如何变成向量表示,并回到大语言模型串联输入与生成过程。
来源与修订
从原始文本训练、编码与解码子词序列的机制参考 SentencePiece 论文 [S1];有限词表用子词组合处理罕见词的动机参考 BPE 子词论文 [S2]。本文不承诺任何字符串在不同模型中具有相同切分或 Token 数量。
Learning navigation
学习导航
同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。
Source register
核验来源
- SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text ProcessingarXiv · 访问于 2026-07-29
- Neural Machine Translation of Rare Words with Subword UnitsarXiv · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29