它是什么
A/B 测试是把用户随机分成两组或多组,分别体验不同方案,再比较真实行为指标的实验方法。它用来判断一个改动是否真的带来因果改善,而不是靠感觉或「上线后再说」。
为什么需要它
很多「看起来更好」的改动上线后没效果甚至有副作用。A/B 测试用随机化排除季节、用户差异等干扰,让「改没改好」有可复现的证据,避免把资源和用户信任浪费在错误改动上。
它如何工作
先定要改善的指标(最好对齐北极星),再确定样本量与时长,随机分配用户到控制组和实验组,只改变一个变量。运行到足够样本后,用统计检验判断差异是否显著。对 AI 产品要额外注意:模型、提示词、延迟等都可能成为被测试变量。
必须澄清的误会
A/B 测试 ≠ 在线评估。 A/B 测试强调双组随机对照与因果推断,是在线评估中标准最严谨的实验形态;在线评估的范畴更广,还包含了不依赖随机分流的线上抽检、影子运行和历史基线对比。
A/B 测试 ≠ 产品数据分析。 数据分析观测并解释已有数据,A/B 测试主动做实验产生新数据;前者看发生了什么,后者试什么会不一样。
真实例子
一个 AI 客服助手想测试「默认展示引用原文」是否提升信任。团队把坐席随机分成两组,一组默认展开引用、一组默认折叠,观察「坐席采纳率」和「回复编辑时间」。结果若采纳率显著上升,才把默认展开推向全量。
什么时候适合与不适合
适合:有足够流量、需要因果结论、改动可被随机化。慎用:样本不足会得出假显著;同时改多个变量无法归因;高风险或隐私敏感场景要谨慎设计。A/B 测试是因果工具,不是所有决策都需要它。
亲自试一下
挑一个你想改的地方,写出「要改善的指标、控制组与实验组的区别、如何随机分组、跑多久够样本」。检查是否只改了一个变量,以及结论能否用统计检验支持。
接下来学什么
配合北极星指标选对实验指标,用产品数据分析建立埋点与漏斗,再结合上线与增长把验证过的改动推向用户。
来源与修订
A/B 测试的随机化与因果判断依据其通用定义 [S1] 与在线受控实验的方法指南 [S2]。本版强调「单变量、足够样本、对齐关键指标」,不把 A/B 测试写成唯一的决策手段。
Learning navigation
学习导航
沿认知链路:你现在在第 7 站,下一站是「给安全 · 什么时候必须有人管」:先沿主路径补上这一层。
Relation topology
基础定义单元 · 暂无直接强依赖关系
「A/B 测试」在当前知识体系中作为底层基准概念建立,不直接依赖其它前置概念,亦未设定强约束关联。读者可直接阅读正文理解其内涵,或前往全网概念图谱探索整体领域架构。
Source register
核验来源
- A/B testingWikipedia · 访问于 2026-08-13
- Trustworthy Online Controlled ExperimentsRon Kohavi · 访问于 2026-08-13
发布 2026-08-13 · 更新 2026-08-13 · 核验 2026-08-13