它是什么
注意力机制让模型根据当前计算目标,为一组候选信息分配不同权重,再把这些信息汇总成当前需要的表示。它解决的不是“永久记住什么”,而是“这一步计算更应参考哪些部分”。[S1][S2]
为什么需要它
序列中的重要信息常分散在不同位置。早期编码器解码器若把整个输入压进单个固定长度向量,长句信息容易形成瓶颈;注意力允许模型在生成每个输出时重新选择相关输入位置。[S1] 这种动态选择后来成为 Transformer 的核心构件。[S2]
它如何工作
常见实现先用查询表示“当前要找什么”,用键描述候选信息,再计算查询与各个键的匹配分数。分数归一化后成为权重,模型按权重汇总对应的值。[S2] 查询、键和值可以来自不同序列,也可以来自同一序列;打分函数和约束方式会随架构变化。
真实例子
翻译“the bank of the river”中的“bank”时,模型需要更多参考“river”,而翻译“the bank approved the loan”时则需要参考“loan”和“approved”。注意力权重会随当前输入与输出位置改变,而不是为“bank”保存一个永远不变的含义。
什么时候适合与不适合
适合需要从多项输入中动态汇总相关信息的序列或多模态任务。它能缩短远距离信息之间的计算路径,但会增加打分和汇总成本;权重只描述某次模型计算中的信息分配,不能单独证明人类式理解、业务因果关系或输出事实正确。自注意力也只是注意力的一种结构。
亲自试一下
目标是区分“当前问题”与“候选信息”。写一段三句短文,再提出两个不同问题;分别给每句话分配总和为 100% 的参考权重,并说明为什么同一句话在两个问题下权重不同。若权重不随问题改变,就还没有体现注意力的动态性。
接下来学什么
继续学习自注意力理解同一序列内部如何建立关系,再阅读Transformer 架构观察注意力如何进入完整网络;最后回到大语言模型和上下文窗口,理解这种机制在实际模型中的作用与信息边界。
来源与修订
动态选择源序列位置及固定长度表示瓶颈参考 Bahdanau 等人的注意力论文 [S1];查询、键、值和多头注意力机制参考 Transformer 论文 [S2]。本文不把注意力机制等同于自注意力,也不把注意力权重直接视为因果解释。
Learning navigation
学习导航
同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。
Source register
核验来源
- Neural Machine Translation by Jointly Learning to Align and TranslatearXiv · 访问于 2026-07-29
- Attention Is All You NeedarXiv · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29