评估、可观测性与质量进阶已核验核验于 2026-09-21

评测集

Evaluation Set

按自己的场景组织的输入、期望结果与必要标签的集合,用来把「这次改动有没有变好」变成可重复回答的问题。

本页目录
快速跳转

它是什么

评测集是你为自己场景攒下的一组可重复运行的题:每条通常包含一个输入、一个期望结果(或一段判定标准)、以及为了让判定能自动执行而需要的人工标注。它的唯一职责是回答一个问题:这次改动,让系统变好了还是变差了。[S1]

它和「随手试几个例子」的差别有两条:固定(题目不变,才能比较前后)与覆盖(题目要专门包含那些容易出错的情况,而不只是正常情况)。少了任一条,它提供的就只是感觉,不是证据。

为什么需要它

因为没有它,团队对「好没好」的判断会退化成三种替代品,而且每一种都很有说服力:

  • 看几个例子就下结论——你随手挑的那几个,恰好都是它擅长的场景;
  • 看单个指标——满意率上升了,但没人知道它是靠更好地回答,还是靠少回答;
  • 看 demo——演示用的输入是精挑过的,而线上没有精挑过的输入。

评测集的作用是把这三种替代品换成一个可复现的数字,并且这个数字可以被别人推翻——他可以说「你这 10 条题不代表性」,但这句话本身就成了可以讨论的具体问题。这比争论「我感觉它变好了」要高效得多。

NIST 把测试、评估、验证与确认(TEVV)列为 AI 系统可信性的必要环节,理由正是:没有可复现的测量,关于系统能力的说法就只是主张。[S1][S2]

它如何工作

从零开始建一个能用的小评测集,顺序通常是这样的:

  1. 先定判定方式,再出题。 你打算怎么判断一条答得对不对?有标准答案、有客观字段、还是需要按标准打分?判定方式决定了题目该怎么写——如果一条题的判定方式还没想清楚,这条题就先别加。
  2. 按失败类型配比,而不是按业务占比配比。 真实业务里 90% 是简单问题,但评测集里应该刻意提高难例和边界例的比例,否则整体通过率会很好看,而问题全被平均掉。常见的三类要分别出现:答错(用了错误信息)、答不全(漏掉关键约束)、编造(资料里没有却给了答案)。
  3. 留一批不常用作调试的题。 如果你每次改提示词都盯着全部题目调,评测集就会慢慢被「对着题过拟合」。留出 20% 只在决定发布时才跑,能保留下它对真实效果的指示能力。
  4. 让它可运行。 一次评测要能自动跑完并输出通过率与失败清单,否则它会在忙起来时第一个被跳过。

评测集的常见形态是二三十条起步,随线上发现的新问题持续增补——每修一个线上 bug,就把它变成一条新题,这是让评测集与真实世界保持同步的最省力方式。

必须澄清的误会

评测集 ≠ 基准测试。 基准测试(benchmark)是公共的、别人定好的题集,用途是横向比较模型——它能告诉你「换一个模型大概会怎样」,但不能告诉你「我们这次改的提示词在我们自己的场景里有没有变好」,因为它的题目不是你的场景。评测集恰恰相反:范围很窄,但直接对得上你的业务。两者是互补的,不能互相替代。

评测集 ≠ 黄金数据集。 「黄金」强调每条都有权威且唯一正确的答案。但很多真实任务的正确答案不唯一(一份好的摘要可以有多种写法),这时强求唯一答案会让你只接受恰好匹配的那一种。评测集的要求更低也更关键:可重复比较。判定可以是「包含这三个要点」,可以是「按量规打分」,不必是唯一字符串。

它不是一次性的交付物。 评测集会有生命周期:题目会过时(业务变了)、会被过拟合(一直盯着它调)、会失衡(只往里加出过错的那类题)。一份三个月没动过的评测集,通常已经不再反映当前的真实风险。

最需要留神的一条误解:评测集不是「证明我们做得不错」的材料。 如果它从来没有让团队放弃过一次改动,那它大概在起装饰作用。

真实例子

一个合同问答助手的评测集可以这样组织:20 条题,其中 8 条是正常条款查询,6 条是跨条款的约束类问题(答案需要综合两处条款,容易答不全),3 条是资料里没有、应当明确说「查不到」的问题,3 条是措辞含糊、需要澄清而不是硬答的问题。[S1][S2]

跑一次得到的结果会呈现这样的形状:正常查询 8/8,跨条款 3/6,越界 2/3,含糊 0/3。这个结果的价值不在于总分(13/20),而在于它指出改动的方向:问题集中在「答不全」和「不敢说不知道」两类上。如果只看总分,你会以为这是一个「大概还行」的系统。

什么时候适合与不适合

适合:任务有明确的成功判据(哪怕判据是「包含若干要点」);系统会有多次迭代,需要判断每次改动的影响;上线后有合规或质量责任需要说明。

不适合:探索期、任务定义每天都在变——这时候出题本身就不稳定,应该先用小样本人工评估把任务收敛下来。也不适合把「收集题目」当成终点而无人跑它:一份没人运行的评测集不产生任何价值。

过拟合与选择偏差是两类不同的失真,各自要对症。 一种是过拟合:反复对着同一批题调参,通过率涨了但线上没变好。对策是留出隐藏题集并定期换题。另一种是选择偏差:出题的人只写自己想到的场景,于是评测集漏掉了真实用户最常遇到的输入。对策是从生产日志里取真实输入来出题,而不是凭想象写。

亲自试一下

用约 40 分钟为你手上的场景写 10 条题:

  1. 写输入:尽量抄真实的用户输入(从日志里找),不要自己改写得更通顺。
  2. 写期望:为每条写下「怎样算答对」,能客观判定就写客观标准。
  3. 标类型:把 10 条分成答错 / 答不全 / 编造三类,看每类有几条。
  4. 跑一遍:记录通过率和失败清单,重点写下失败集中在哪一类。

观察点不是那个通过率,而是:这 10 条里,有几条你现在已经能预测它会失败? 能预测的题说明你对系统边界的认识已经清楚,剩下那些你预测错的题才是这次评测真正的收获。

接下来学什么

评测集是这一站(给判断)的起点:先有题,再谈好坏。 顺着走下去是 AI 评估(怎么组织判定)、大模型裁判(怎么低成本打分)、依据一致性(针对「编造」这一类失败的具体维度),以及 可观测性(把线上的真实失败变成新的题)。

如果你还没有「做检索」这个前提,可以先看上一站 给知识:检索增强生成 的失败模式恰好对应评测集里最需要覆盖的那几类。如果你正在纠结「用公共榜单行不行」,回头读一遍 基准测试 与本条的差别。

来源与修订

把测试、评估、验证与确认作为可信 AI 的必要环节,并强调评估需覆盖风险与影响,来自 NIST 的 AI Test, Evaluation, Validation and Verification (TEVV) 与 ARIA Pilot Evaluation Report。[S1][S2]

需要说明一处边界:「先定判定再出题」「按失败类型配比而不是按业务占比配比」「留 20% 隐藏题」「每修一个线上 bug 就加一条题」这四条操作规则,是本站在整理评测集实践时总结的,不是上述来源的原文。NIST 的文档面向评估框架与风险维度,不给出题集的规模与配比细则。

2026-09-21 按决策页规范重写,本次修订补入「先定判定再出题」、失败类型配比与隐藏题集的作用,把评测集与「随手试几个例子」区分开。

Learning questions

这个概念出现在哪些题里

下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。

Case practice

这个概念出现在哪些案例里

案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。

Learning navigation

学习导航

沿认知链路:你现在在第 7 站,下一站是「给安全 · 什么时候必须有人管」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

评测集的一层关系

2 个节点 · 1 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Related names

相关名词

下面这些名字与「评测集」讲的是同一块知识,内容已并入本页, 不再单独作为入口出现。保留链接是为了让旧地址仍然能打开。

  • 毒性评估Toxicity Evaluation

    与同域词条「评测集」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。

  • 偏见评估Bias Evaluation

    与同域词条「评测集」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。

  • 自动评估Automatic Evaluation

    与同域词条「评测集」讲的是同一块知识,不再单独作为入口;内容已并入该词条,本页只作旧链接的落点。

Source register

核验来源

  1. AI Test, Evaluation, Validation and Verification (TEVV)NIST · 访问于 2026-09-21
  2. Assessing Risks and Impacts of AI - ARIA Pilot Evaluation ReportNIST · 访问于 2026-09-21

发布 2026-08-20 · 更新 2026-09-21 · 核验 2026-09-21