它是什么
预训练是在模型服务具体下游任务之前,先用大规模数据和通用训练目标学习可复用表示或生成规律的训练阶段。完成预训练的模型通常还要经过提示、微调或后训练,才能适配具体交互与业务要求。[S1][S2]
为什么需要它
为每个任务从零训练大型模型需要大量数据和计算。预训练把通用模式的学习集中在一个阶段,使多个下游任务能够复用同一组参数。BERT 展示了预训练表示只需增加较小任务层并微调,就能应用到问答、推断等多类语言任务。[S1]
它如何工作
团队先选择数据、模型结构和自监督目标,再反复计算预测误差并更新参数。BERT 使用遮盖语言建模,让模型根据左右上下文预测被遮盖的 Token。[S1] 其他模型也可以预测后续 Token 或使用不同目标。训练目标决定模型被奖励学习什么,但不会逐条告诉模型哪些输出在真实产品中可接受。
真实例子
一个语言模型先在广泛文本上预训练,学会常见表达和上下文模式;客服团队随后用产品说明、示例提示或微调让它适应内部术语。若预训练数据缺少某个新产品,模型不会因为训练规模大就自动掌握最新政策,团队仍需提供资料并验证回答。
什么时候适合与不适合
适合能力可被多个任务复用、团队有足够数据与计算或能采用现成模型的场景。预训练成本高,数据偏差、版权、安全缺陷和错误模式可能被多个下游应用继承。[S2] 更低的预训练损失也不等于事实正确、指令遵循或业务指标达标,这些目标需要独立的后续训练和评估。
亲自试一下
目标是区分训练目标与产品目标。为“根据上下文预测被遮盖 Token”写出模型会收到的输入、目标答案和损失信号,再列出客服产品仍需验证的三项结果。若产品验收项无法从预训练损失直接得出,就说明为什么还需要适配与评估。
接下来学什么
先回顾训练数据理解能力来源,再阅读基础模型和大语言模型理解复用方式;接着比较微调和后训练,区分通用模式学习、任务适配与行为塑造。
来源与修订
遮盖语言建模、双向预训练和下游微调机制参考 BERT 论文 [S1];广泛数据训练、适配价值与下游继承风险参考 Stanford CRFM 基础模型报告 [S2]。本文不把预训练完成度等同于产品可用性。
Learning navigation
学习导航
同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。
Source register
核验来源
- BERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingarXiv · 访问于 2026-07-29
- On the Opportunities and Risks of Foundation ModelsStanford CRFM · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29