AI 产品与用户体验进阶已核验核验于 2026-07-30

任务成功率

Task Success Rate

在预先定义的成功标准下正确完成任务的次数占总尝试次数的比例,应结合失败类型解释。

本页目录
快速跳转

它是什么

任务成功率是在一个已定义的评测设置中,满足预先声明成功标准的成功试验数除以全部有效试验数。若 150 次有效试验中有 126 次达到标准,任务成功率就是 84%。这里的任务、成功、有效试验和运行配置都必须先定义;只报告“成功率 84%”无法说明系统究竟做对了什么。[S1][S2]

为什么需要它

生成式系统的回答会变化,复杂任务还可能在多个步骤中的任何一处失败。任务成功率把“感觉大多能用”转成可以重复比较的结果,可用于检查提示词、模型或工具版本是否进步。但如果标准过宽、样本不代表真实使用,或只看平均值,漂亮的百分比仍会掩盖严重失败。

它如何工作

先定义任务输入、必须达到的最终结果和无效试验处理规则,再选择代码检查、人工量规或经过校准的模型评分器。每次完整尝试是一项试验;对存在随机性的系统,应在同一任务上运行多次并保存配置。汇总时同时报告成功数、有效试验总数、置信区间或波动,以及按失败类型和重要子群拆分的结果。OpenAI 强调代表性样本与持续评测,Anthropic 则把任务、试验和评分器作为 Agent 评测的基本组成。[S1][S2]

必须澄清的误会

任务成功率 ≠ 北极星指标。 北极星指标是全局目标,通常自上而下定义;任务成功率是具体任务上的完成比例,常作为它的支撑指标。

任务成功率 ≠ AI 评估。 AI 评估看模型输出质量(对不对、有没有依据);任务成功率看用户侧的结果(有没有把事办完),两者可以一个高一个低。

真实例子

日程 Agent 在 50 个代表性任务上各运行 3 次,共 150 次有效试验。预先规定只有“选择正确参会人、创建正确时间的日程且未越权发送”才算成功。126 次全部满足,成功率为 84%;18 次因权限判断失败,6 次选错时区。团队不能只发布 84%,因为权限失败影响更严重,也需要分别检查不同任务和重复试验的稳定性。

什么时候适合与不适合

成功标准可以清楚判断、任务能够重复执行时,任务成功率适合作为核心结果指标。开放式创作、部分完成也有价值或失败严重度差异很大的任务,单一二元成功率不够,应补充量规分、关键失败率、人工评价、成本和延迟。这个指标只对当时的任务集、配置、试验次数与评分器有效,也不能替代线上监控和用户反馈。[S1][S2]

亲自试一下

为一个 AI 功能准备 10 个任务,每个运行 3 次。先写出一条同时包含结果质量、权限和副作用的成功规则,再明确超时、工具故障和无效输入是否进入分母。完成后报告“成功次数 / 有效试验次数”、总体百分比和三类主要失败;如果不同人无法按规则得到一致判断,就先修订评分器,不急着比较模型。

接下来学什么

回到AI 产品把任务指标连接到用户价值,再学习离线评估建立受控测试集、用在线评估观察真实使用,并通过置信度校准判断系统表达的把握程度是否可信。

来源与修订

评测目标、代表性数据、指标、评分器校准和持续评测参考 OpenAI 评测最佳实践 [S1];任务、试验、评分器、多次运行及能力与回归评测的区分参考 Anthropic Agent 评测实践 [S2]。公式相对稳定,但成功定义、评分器、任务分布、模型版本和产品目标会持续变化。

Learning questions

这个概念出现在哪些题里

下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。

Case practice

这个概念出现在哪些案例里

案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。

Learning navigation

学习导航

沿认知链路:你现在在第 4 站,下一站是「给接口 · 怎么标准化地接系统」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

任务成功率的一层关系

2 个节点 · 1 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Source register

核验来源

  1. Evaluation best practicesOpenAI · 访问于 2026-07-30
  2. Demystifying evals for AI agentsAnthropic · 访问于 2026-07-30

发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30