它是什么
任务成功率是在一个已定义的评测设置中,满足预先声明成功标准的成功试验数除以全部有效试验数。若 150 次有效试验中有 126 次达到标准,任务成功率就是 84%。这里的任务、成功、有效试验和运行配置都必须先定义;只报告“成功率 84%”无法说明系统究竟做对了什么。[S1][S2]
为什么需要它
生成式系统的回答会变化,复杂任务还可能在多个步骤中的任何一处失败。任务成功率把“感觉大多能用”转成可以重复比较的结果,可用于检查提示词、模型或工具版本是否进步。但如果标准过宽、样本不代表真实使用,或只看平均值,漂亮的百分比仍会掩盖严重失败。
它如何工作
先定义任务输入、必须达到的最终结果和无效试验处理规则,再选择代码检查、人工量规或经过校准的模型评分器。每次完整尝试是一项试验;对存在随机性的系统,应在同一任务上运行多次并保存配置。汇总时同时报告成功数、有效试验总数、置信区间或波动,以及按失败类型和重要子群拆分的结果。OpenAI 强调代表性样本与持续评测,Anthropic 则把任务、试验和评分器作为 Agent 评测的基本组成。[S1][S2]
必须澄清的误会
任务成功率 ≠ 北极星指标。 北极星指标是全局目标,通常自上而下定义;任务成功率是具体任务上的完成比例,常作为它的支撑指标。
任务成功率 ≠ AI 评估。 AI 评估看模型输出质量(对不对、有没有依据);任务成功率看用户侧的结果(有没有把事办完),两者可以一个高一个低。
真实例子
日程 Agent 在 50 个代表性任务上各运行 3 次,共 150 次有效试验。预先规定只有“选择正确参会人、创建正确时间的日程且未越权发送”才算成功。126 次全部满足,成功率为 84%;18 次因权限判断失败,6 次选错时区。团队不能只发布 84%,因为权限失败影响更严重,也需要分别检查不同任务和重复试验的稳定性。
什么时候适合与不适合
成功标准可以清楚判断、任务能够重复执行时,任务成功率适合作为核心结果指标。开放式创作、部分完成也有价值或失败严重度差异很大的任务,单一二元成功率不够,应补充量规分、关键失败率、人工评价、成本和延迟。这个指标只对当时的任务集、配置、试验次数与评分器有效,也不能替代线上监控和用户反馈。[S1][S2]
亲自试一下
为一个 AI 功能准备 10 个任务,每个运行 3 次。先写出一条同时包含结果质量、权限和副作用的成功规则,再明确超时、工具故障和无效输入是否进入分母。完成后报告“成功次数 / 有效试验次数”、总体百分比和三类主要失败;如果不同人无法按规则得到一致判断,就先修订评分器,不急着比较模型。
接下来学什么
回到AI 产品把任务指标连接到用户价值,再学习离线评估建立受控测试集、用在线评估观察真实使用,并通过置信度校准判断系统表达的把握程度是否可信。
来源与修订
评测目标、代表性数据、指标、评分器校准和持续评测参考 OpenAI 评测最佳实践 [S1];任务、试验、评分器、多次运行及能力与回归评测的区分参考 Anthropic Agent 评测实践 [S2]。公式相对稳定,但成功定义、评分器、任务分布、模型版本和产品目标会持续变化。
Learning questions
这个概念出现在哪些题里
下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。
Case practice
这个概念出现在哪些案例里
案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。
Learning navigation
学习导航
沿认知链路:你现在在第 4 站,下一站是「给接口 · 怎么标准化地接系统」:先沿主路径补上这一层。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索任务成功率的一层关系
2 个节点 · 1 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Source register
核验来源
- Evaluation best practicesOpenAI · 访问于 2026-07-30
- Demystifying evals for AI agentsAnthropic · 访问于 2026-07-30
发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30