AI 产品与用户体验进阶已核验核验于 2026-07-31

置信度校准

Confidence Calibration

让系统表达的确定程度与实际正确概率尽量一致,以支持更合理的人类判断。

本页目录
快速跳转

它是什么

置信度校准描述系统给出的概率分数与实际结果频率是否对应。若许多预测都标为 80% 置信度,那么在相同定义和条件下,这组预测应大约有 80% 正确。它是对一组预测的统计性质,不是对某一次回答“有八成把握”的证明,也必须先说明分数对应的事件是什么。[S1]

为什么需要它

产品常用置信分数决定自动执行、请求补充信息或转交人工。如果系统过度自信,错误会越过复核;如果过度保守,原本可自动完成的任务会产生不必要成本。校准让阈值与可观察风险建立联系,使团队能讨论“低于多少需要升级”,而不只是比较一个看似精确的数字。

它如何工作

先定义要预测的事件和可获得的真实结果,再准备不参与模型训练或方法选择的代表性校准数据。把预测按分数区间分组,比较每组平均分数与实际正确率,并用可靠性图或校准误差检查偏差。若分数系统性过高或过低,可在独立数据上拟合温度缩放等后处理;模型、数据或使用场景变化后必须重新测量。Guo 等人的实验显示,温度缩放在其研究数据集上是一种简单有效的方法,但结果不能脱离实验条件推广。[S1][S2]

必须澄清的误会

置信度校准 ≠ 不确定性呈现。 不确定性呈现是界面怎么把这个信号画给用户(区间、措辞、颜色);置信度校准是信号本身准不准。

置信度校准 ≠ 人工升级处理。 升级处理是超过某个阈值就把任务交给人;校准决定这个阈值定在哪才合理。

真实例子

退款审核模型为 1,000 个已完成案例输出“材料完整”的概率。团队发现 0.8 至 0.9 区间共有 200 例,实际只有 130 例判断正确,说明这一区间明显过度自信。团队用单独校准集调整分数,再在新的保留集复测;产品把低于 0.75 的案例交给人工,并继续按月份和客户类型观察分组差异,而不是把新分数当作永久真值。

什么时候适合与不适合

当任务有清楚结果、系统会输出可解释的概率,并且分数要驱动阈值决策时,校准很有价值。开放式生成通常没有单一即时正确标签,模型口头说“我有 90% 把握”也不自动构成可校准概率。整体校准良好仍可能掩盖重要子群偏差;校准也不等于准确率提高,更不能证明未测试分布中的可靠性。[S1][S2]

亲自试一下

收集至少 100 个带二元结果的历史预测,保留原始分数并按 0.1 区间分组。为每组计算平均分数和实际正确率,再找出差距最大的区间。只有你能说明分数对应的事件、样本为何代表目标场景,并为模型或数据变化写出复测条件,这次校准检查才算完整。

接下来学什么

先用不确定性呈现决定用户真正需要看到什么,再以任务成功率衡量完整任务结果;通过在线评估检查部署分布变化,并在风险超过阈值时接入人工升级处理。

来源与修订

概率分数与经验正确率的定义、可靠性测量和温度缩放参考 Guo 等人的校准研究 [S1];不确定性度量、基准、部署条件、重新校准与持续监测边界参考 NIST AI RMF Core [S2]。模型架构、分数语义、校准数据和部署分布变化后均需复核。

Learning questions

这个概念出现在哪些题里

下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。

Learning navigation

学习导航

沿认知链路:你现在在第 4 站,下一站是「给接口 · 怎么标准化地接系统」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

置信度校准的一层关系

2 个节点 · 1 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Source register

核验来源

  1. On Calibration of Modern Neural NetworksPMLR · 访问于 2026-07-31
  2. NIST AI Risk Management Framework CoreNIST · 访问于 2026-07-31

发布 2026-07-31 · 更新 2026-07-31 · 核验 2026-07-31