它是什么
大语言模型是在大规模数据上训练、以 Token 序列为主要输入输出的模型。许多现代 LLM 使用 Transformer 架构,能在同一个上下文里建模相距很远的 Token 之间的关系。
它的分界不在「参数多大」,而在通用性:同一个基础模型,靠提示、示例或进一步训练就能支持摘要、问答、翻译、代码和信息抽取等一大批任务——不必再为每个语言任务单独训一个模型。这正是这类模型区别于此前「一任务一模型」路线的核心。
所以它是一个通用模型:不是某个功能的插件,不是知识库,也不是一套规则引擎。
为什么需要它
在它出现之前,做「从客户来信里抽问题类别」这件事需要标注数据、训练一个分类模型、再维护它;换一个任务,整套流程重来。而语言任务的边界特别宽——规则几乎不可能穷举(一句话的意思取决于上下文、语气、隐含前提)。
大语言模型把这笔账改了:一个模型加一段提示,就能覆盖一大片「说不清规则但人能判断」的任务。门槛的下降不是效率上的几个百分点,而是「以前根本不会去做」的一类需求变得可做。
代价同样清楚:它把「靠规则可解释」换成了「靠概率能泛化」。所以你拿到的是覆盖面,失去的是可追溯性——这个交换是理解后面所有工程手段的前提。
它如何工作
两个阶段:
- 预训练:让模型反复预测被遮盖的或后续的 Token,从海量样本里学出语言与世界的统计结构。这一步产出的是「基础模型」——它会续写,但还不太会听话。
- 后训练:进一步塑造指令遵循、格式输出与安全行为。你日常用到的是这一步之后的成品。
使用时,模型依据当前上下文计算候选 Token 的概率并逐步生成。
三个机制事实最容易影响产品决策:
- 知识存在参数里,因此不可逐句追溯。 你可以问它「依据是什么」,但它给的理由是生成的,不是回查出来的。
- 参数不会因为一次对话而改变。 想让它知道新东西,你得把新东西放进上下文(或走微调),而不是「告诉它一次」。
- 生成是逐步采样。 输出长度直接换算成时间与费用,而同一个问题两次结果可能不同。
必须澄清的误会
大语言模型 ≠ 生成式 AI。 后者是更大的一类:只要模型会产出新内容,图像生成、语音合成、视频生成都在里面。大语言模型是其中以语言序列为对象的那一支。把两者当同义词,会在讨论「生成式 AI 的风险」时把语言特有的问题(编造事实、提示词注入)和图像特有的问题(版权、深伪)混在一起。
大语言模型 ≠ 知识库。 这是最影响产品设计的一条。参数里的知识说不清出处、会过时、也无法审计。任何需要「给出依据」「保证是最新版本」「按权限区分可见范围」的场景,都不能靠参数里的知识实现——那正是 RAG 存在的理由。判断方法很简单:如果你需要指着某一句话说是哪来的,参数知识就不够用。
「看过」不等于「记住」。 你这次把文件放进上下文窗口,它这次能读;对话结束,参数没变,下次它仍然不知道。「它刚才明明看过」和「它知道了」之间,差的是一次检索。
「大」不等于「参数多」。 参数规模只是手段之一。真正的分界是通用性——一个模型能否被适配到多种任务。所以比较两个模型时,「谁参数多」远不如「在你的任务集上谁表现好」有意义,而后者需要评测,不能靠直觉。
真实例子
给模型一封客户来信加一组结构化字段(产品、金额、日期),它可以一次生成三样东西:问题类别、紧急程度、以及一段回复草稿。
注意这三样的性质完全不同:类别和紧急程度是可校验的结构化判定(能写规则核对、能统计准确率);回复草稿是开放文本(只能靠人读或按量规评分)。
同一个上下文、同一次调用,产出物的可信度却差别很大。这就是为什么「用它做了 X」这句话本身信息量很低——真正决定能不能上线的是「产出物能不能被校验」。 在这次调用里,前两项可以自动过阈值上线,第三项需要分级:低风险场景可用,对外的正式回复仍需人工过一遍。
什么时候适合与不适合
适合:语言边界宽、规则难以穷举、且允许评估与复核的任务——摘要、改写、分类、抽取、初稿生成。
不适合:把内部参数当成可审计知识库;也不应默认它的输出最新、完整或真实。此外还有一种更隐蔽的误用——用它做确定性计算(算账、算库存、算规则推导)。语言模型擅长的是语言,不是算术与逻辑推导;这类任务该交给代码、数据库或工具,而不是靠它「算」。
一个实用的落地顺序:先问这份产出能不能被自动校验。能校验的,可以放自动;不能校验的,必须设计复核环节。这条判断比「模型够不够强」更能决定一个功能能不能上线。
亲自试一下
拿同一份材料(一篇真实文档或一封邮件),跑三个提示:
- 自由问答——随便问一个材料里能回答的问题。
- 要求引用原文——明确要求它指出依据的原文片段。
- 要求输出固定 JSON——给出字段定义,要求严格按格式输出。
全程约 25 分钟。观察点是比较三者的准确性、稳定性和可验证性:自由问答应得最自然但最难核对;要求引用时它会给出片段(注意核对是不是原文真有,这是最容易被跳过的一步);要求 JSON 时格式可能偶发破坏。
记录哪一种约束最有效——通常你会得到一个反直觉的结论:加约束不总是降低质量,很多时候它让结果变得可校验,因而变得可用。
接下来学什么
大语言模型是第 1 站 地基 · 模型是什么 的入口概念,这一站的其余词条合起来解释它的行为。
顺着本站走:先看它的计量单位 Token,再看它一次能看到多少 上下文窗口,最后看这个工作方式的后果 幻觉——这三条合起来就是「它为什么必然会编」的完整答案。
往下一站是 沟通 · 怎么把需求说清楚:同一个模型,输出质量的差距主要来自你给的上下文与约束。等你要让它回答你司的内部问题,就进入第 3 站 给知识 的 RAG。
来源与修订
Transformer 架构与「在序列上建模远近距离关系」的机制背景,参考 Attention Is All You Need(arXiv 1706.03762);「同一个基础模型被适配到多种下游任务」这一通用性定位,以及随之而来的机会与风险,参考 Stanford CRFM 的 On the Opportunities and Risks of Foundation Models(arXiv 2108.07258)。
两处刻意的留白:本文不以参数规模单独定义「Large」——规模是手段,通用性才是分界;也不固化任何模型版本或榜单数字,那类信息寿命很短,写进概念词条只会迅速失真。
修订日期 2026-09-19:本条由生成模板改为决策页——补「必须澄清的误会」一节(对生成式 AI、对上下文窗口、对幻觉),把「预训练/后训练两阶段」与「三条影响产品决策的机制事实」写实,去掉生成期的引用标记,补 boundaries 与 minAction。
Case practice
这个概念出现在哪些案例里
案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。
Learning navigation
学习导航
沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索大语言模型的一层关系
11 个节点 · 15 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Related names
相关名词
下面这些名字与「大语言模型」讲的是同一块知识,内容已并入本页, 不再单独作为入口出现。保留链接是为了让旧地址仍然能打开。
- 采样Sampling
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 核采样Top-p Sampling
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 后训练Post-Training
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 混合专家模型Mixture of Experts
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 基础模型Foundation Model
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 解码策略Decoding Strategy
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 开放权重模型Open-Weight Model
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 模型量化Model Quantization
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 模型推理Model Inference
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 模型蒸馏Model Distillation
与同域词条「大语言模型」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。
- 预训练Pretraining
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 注意力机制Attention Mechanism
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- 自注意力Self-Attention
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
- Transformer 架构Transformer
同域内缺少可支撑独立入口的区分度,读者真正要的是「大语言模型」这一层;内容已并入该词条,本页只作旧链接的落点。
Source register
核验来源
- Attention Is All You NeedarXiv · 访问于 2026-09-19
- On the Opportunities and Risks of Foundation ModelsStanford CRFM · 访问于 2026-09-19
发布 2026-07-29 · 更新 2026-09-19 · 核验 2026-09-19