它是什么
自注意力是注意力机制的一种:查询、键和值都来自同一序列,使序列中每个位置能够根据当前内容汇总其他位置的信息。经过计算后,同一个 Token 在不同上下文中可以形成不同表示。[S1][S2]
为什么需要它
理解一句话往往需要连接相隔较远的词,例如代词指向、否定范围和条件关系。自注意力允许这些位置直接比较,不必只沿序列一步步传递信息;训练时也能并行处理多个位置,因此成为 Transformer 的关键组成部分。[S1]
它如何工作
每个输入位置被映射为查询、键和值。某个位置的查询与所有可见位置的键计算匹配程度,再按权重汇总对应的值;多头自注意力可并行学习不同关系。[S1] 因为自注意力本身不携带顺序,模型还需要位置表示;生成模型也常用掩码阻止当前位置看到未来 Token。
真实例子
在“银行批准了客户的贷款,因为他信用良好”中,处理“他”时可以汇总“客户”“信用”等位置的信息。若把“客户”换成“公司”,相关位置和最终表示也会变化。自注意力形成的是上下文相关表示,不是预先写好的代词规则表。
什么时候适合与不适合
适合需要建立全局上下文关系并支持并行训练的任务。标准全自注意力要比较大量位置对,每层计算复杂度会随序列长度呈二次增长;它也只是 Transformer 层的一部分,仍需位置表示、前馈层、残差连接等结构。注意力分数较高同样不保证对应关系就是唯一正确解释。
亲自试一下
目标是观察成对关系数量如何增长。分别画出 3 个和 6 个 Token 的方格,让每行表示一个查询、每列表示一个可参考位置,并数出格子总数。若序列长度翻倍而格子变成四倍,就能看到标准全自注意力处理长上下文时的成本来源。
接下来学什么
先回到注意力机制区分上位概念,再阅读Transformer 架构理解完整层结构;结合Token和上下文窗口分析序列长度,最后回到大语言模型理解它如何成为实际模型的核心机制。
来源与修订
查询、键、值、多头结构、位置表示和复杂度参考 Transformer 论文 [S1];双向上下文中的自注意力应用参考 BERT 论文 [S2]。本文只解释标准全自注意力,不把所有高效或稀疏变体概括成同一种实现。
Learning navigation
学习导航
同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。
Source register
核验来源
- Attention Is All You NeedarXiv · 访问于 2026-07-29
- BERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingarXiv · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29