大语言模型与生成式 AI进阶已弃用核验于 2026-07-29

Transformer 架构

Transformer

以注意力机制处理序列关系、支持高并行训练的神经网络架构,是现代大语言模型的基础。

本页目录
快速跳转

它是什么

Transformer 是以注意力机制为核心处理序列关系的神经网络架构。原始论文用它替代当时机器翻译系统中的循环和卷积结构,使序列各位置可以直接建立关系并更适合并行训练。[S1]

为什么需要它

处理一句话时,一个词的含义经常依赖相隔很远的词。循环网络需要按顺序传递信息,而自注意力可以直接比较不同位置。Transformer 因而成为现代语言模型的重要基础,也扩展到视觉、音频和多模态任务。[S2]

它如何工作

每个 Token 表示被映射为查询、键和值。查询与各个键计算相关程度,再按权重汇总对应的值;多头注意力同时学习不同关系。位置编码补充顺序信息,前馈层进一步变换表示,残差连接和归一化帮助深层训练。

真实例子

在“银行把贷款批准给客户,因为他信用良好”中,模型处理“他”时可以对“客户”等位置分配更高注意力。它学习的是上下文相关的表示,不是在规则表中固定写下“他永远指客户”。

什么时候适合与不适合

Transformer 适合需要建模长距离关系和大规模并行训练的序列或多模态任务。标准全注意力的计算和内存会随序列长度快速增长;注意力权重也不天然等于可验证解释。具体模型常对原始架构作大量修改。

亲自试一下

写一句包含代词、否定和远距离条件的话,分别标出理解每个关键词需要回看的位置。再尝试删掉一个条件,观察含义如何改变;这能建立“位置之间动态关联”的直觉,而不必先计算矩阵。

接下来学什么

先学习注意力机制和自注意力,再回到大语言模型理解 Transformer 如何与预训练、Token 和生成目标组合。

来源与修订

架构、注意力、位置编码与原始实验依据 Transformer 论文 [S1];当前架构已跨文本、视觉、音频和多模态使用的范围参考 Hugging Face 文档 [S2]。本文不把所有现代模型实现等同于 2017 年原始结构。

Learning navigation

学习导航

沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。

Source register

核验来源

  1. Attention Is All You NeedarXiv · 访问于 2026-07-29
  2. Transformers DocumentationHugging Face · 访问于 2026-07-29

发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29