它是什么
大模型裁判是用一个模型按你给的量规去评价另一个模型的输出。它把评估中最贵的一环——人工逐条打分——换成了自动流程,因此可以让评估从「上线前做一次」变成「每次改动都跑」。[S1]
它的定位必须说清:它是测量工具,不是判断标准。工具会带它自己的偏差,就像卷尺会因为温度而略微伸缩——用之前要知道它偏多少,而不是假装它没有偏差。
为什么需要它
因为人工评估卡在成本上,而成本会直接决定评估的频率。一场人工评审组织起来要排期、要共识、要记录,结果是只在关键节点做;而 AI 系统的质量问题恰恰产生在每一次日常改动里。
大模型裁判把这个成本降到了可以每天跑的程度,于是评估从「里程碑事件」变成了「日常动作」。它带来的最大变化不是准确率,而是频率——能在每次改动后立刻知道涨跌,才谈得上快速迭代。
但它也带来一类新的风险:一个稳定的错误打分,比一个明显失准的分数更危险。人工打分如果标准混乱,团队能看出来;模型裁判分数稳定、格式规范、还带解释,很容易被当成客观事实接受。
它如何工作
一个能用的裁判,要写清四件事:
- 量规:每个维度怎么算达到。量规必须是可判定的描述,而不是形容词——「回答有帮助」不可判定,「回答包含用户问题里的三个约束中的至少两个」可以。量规与评测集是一对:题集定义问什么,量规定义怎么判。
- 输入形式:给裁判的是什么(原始问题 + 资料 + 待评回答)。漏给资料,裁判就只能评流畅度——这是最常见的配置错误,也是「依据一致性」类问题测不出来的原因。
- 输出形式:分数还是等级、每维一个分还是总分、要不要给出理由。理由不是装饰:没有理由就无法审计,也无法发现它按什么标准打分。
- 对照方式:直接打分(给一条打 1–5 分)还是成对比较(两条里选更好的)。成对比较通常比绝对打分稳定,但对「整体水平」的刻画更弱,实践中常两者并用。
需要专门校准的三个偏差:
- 位置偏差:同一对答案交换顺序,结果会变。测法就是交换顺序跑两次,看一致性。
- 自我偏好:裁判偏爱与自己风格相似的输出。跨模型评估时尤其明显。
- 长度偏好:更长的回答常被误判为更好。量规里要显式写明「长度不构成加分项」。
必须澄清的误会
大模型裁判 ≠ 评估。 评估是「判断系统好坏」这件事的整体:它包含题集、量规、抽样方式、由谁负责、结论怎么用。裁判只是其中一种打分手段。把两者混为一谈,会出现「我们把评估自动化了」这种说法,而实际上只是把打分环节自动化了——题目怎么选、结论怎么用,仍然需要人来设计。
大模型裁判 ≠ 基准测试。 基准的分数来自固定的公共题集与客观判定,可以跨系统直接比;裁判的分数来自另一个模型的判断,不能跨系统直接比——换一个裁判模型,分数就变。所以裁判的分数只在同一套配置下纵向比较才有意义:这次改动前的 82 分和改动后的 85 分可以比,我们的 85 分和别家的 85 分不能比。
它是工具,不是真值。 没有「标准答案」这件事在开放任务里是常态,裁判提供的是一致而可重复的判断,不是地面真值。因此抽查是必需的:定期拿一批样本人工复核,量出裁判与人的一致率。这个一致率就是裁判分数的可信度上限——如果它只有 70%,那么 3 分的差异就不该被当作结论。
还有一条常见的误用:用裁判替代人的最终决策。 裁判可以决定「这次改动要不要提测」,不适合决定「要不要上线」。前者错了可以回退,后者影响是外部的。
真实例子
一个客服答复质量的裁判配置可以是:量规分三维——事实是否与资料一致(必须指出依据)、是否回答了用户的实际问题(而不是礼貌地绕开)、是否包含不该给的承诺(例如擅自给出赔付金额)。每维三档,输出必须包含理由。运行方式采用成对比较:新版答复与旧版答复一起给裁判,让它选更好的那一条;每月抽 30 条人工复核。[S1][S2]
一次实测会发现一件很有用的事:把两条答案交换顺序再跑一遍,大约有一成的样本判断反转。这个数字的意义不在于「裁判不能用了」,而在于它给出了这个工具的可信边界:在这个配置下,小于一成的差距不该被当成改进。有了这条,团队就不会为了 2% 的分数波动大动干戈。
什么时候适合与不适合
适合:任务开放但量规可写(摘要、答复、说明文);需要频繁比较版本差异;输出量大到人工无法逐条看。这些场景里,裁判带来的是频率上的质变。
不适合:有确定性判定方式的场景(字段对不对、格式合不合规)——那应该写代码检查,既便宜又准确;以及答案唯一且可核对的任务,用裁判只是引入噪声。也不适合作为唯一防线:裁判与生成模型有共同的失败模式(同样的偏见、同样的盲点),必须配人工抽查。
漂移与自证是两类不同的失真,需要分别设防。 一种是漂移:裁判模型版本更新后,同一批输出的分数整体位移,而团队把它读成「我们的系统变差了」。对策是保留一组固定的校准样本,每次换版本先跑校准。另一种是自证:用同一个模型既生成又评分,它的偏好会让自家输出一直得分高。对策是尽量让裁判来自不同的模型,或至少对同一批输出做跨模型交叉打分。
亲自试一下
用约 45 分钟测一次你自己的裁判(哪怕是用一段提示词临时搭的):
- 取 10 条输出:从你的系统里取真实的输出。
- 写一份简短量规:不超过三个维度,每个维度写清「什么算达标」。
- 跑两次:第一次按原顺序打分,第二次把候选答案的顺序交换后再打一次。
- 对比一致率:算出两次判断一致的比例。
观察点不是那个分数,而是交换顺序后翻转的条数。这个数字直接告诉你:当前配置下多大的差异才值得在意。另外记录一件事——你在写量规时,是否发现有些维度根本没法写成可判定的描述? 那些维度才是真正需要人工评估的部分。
接下来学什么
大模型裁判是这一站(给判断)里解决「怎么低成本地批量打分」的工具。要把它用对,先要有 评测集(题目)与 AI 评估(整体安排),并且要知道它在哪一类失败上最不可靠——那是 依据一致性 的领域,因为「有没有根据资料」这件事裁判自己也会判错。
它和 基准测试 的分工值得再想一遍:基准告诉你「换模型值不值」,裁判告诉你「这次改动涨没涨」。如果你现在连题集都还没有,回到 评测集 那一条先做准备。
来源与修订
把测试与评估作为可信 AI 的必要环节、并强调评估方法本身需要被验证,来自 NIST 的 AI Test, Evaluation, Validation and Verification (TEVV) 与 ARIA Pilot Evaluation Report。[S1][S2]
需要说明一处边界:「位置偏差、自我偏好、长度偏好」这三类偏差的存在是业界共识,但「交换顺序跑两次、以一致率界定可信边界」这个操作方法是本站在做裁判校准时总结的,不是上述来源的原文。NIST 的文档面向评估框架,不提供裁判校准的具体步骤。
2026-09-21 按决策页规范重写,本次修订补入三类偏差的成因与交换顺序的校准方法,并说明裁判分数为何不能跨配置比较。
Case practice
这个概念出现在哪些案例里
案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。
Learning navigation
学习导航
沿认知链路:你现在在第 7 站,下一站是「给安全 · 什么时候必须有人管」:先沿主路径补上这一层。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索大模型裁判的一层关系
2 个节点 · 1 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Source register
核验来源
- AI Test, Evaluation, Validation and Verification (TEVV)NIST · 访问于 2026-09-21
- Assessing Risks and Impacts of AI - ARIA Pilot Evaluation ReportNIST · 访问于 2026-09-21
发布 2026-08-20 · 更新 2026-09-21 · 核验 2026-09-21