它是什么
提示词评测是围绕明确目标、固定样本和预先定义的成功标准,可重复地比较提示词或完整系统版本的过程。它回答的不是“哪个回答看起来更顺眼”,而是“在这组任务和标准下,版本 A 与版本 B 分别表现怎样”。OpenAI 和 Anthropic 都强调先定义成功标准,再构造覆盖真实任务分布的测试。[S1][S2]
为什么需要它
模型输出具有不确定性,一两个满意样例既不能代表常见输入,也容易漏掉边界失败。没有固定评测,团队很难判断一次提示词修改究竟改善了整体表现,还是只修好当前例子却引入新回归。评测把主观争论变成可检查的证据,也为版本升级、模型切换和上线监控提供共同基线。
它如何工作
先写清任务目标和不能接受的失败,再建立包含典型、边界及对抗输入的代表性数据集。随后按任务性质选择确定性代码检查、人工量规或经过校准的模型评分器,保存当前基线,运行候选版本并逐类检查差异。评测集还要持续吸收生产失败和新输入,不能在上线前只跑一次。[S1][S2]
必须澄清的误会
提示词评测 ≠ 提示词。 提示词是被测的指令载体;提示词评测是用系统化数据集与指标量化其表现好坏的质量验证机制。
提示词评测 ≠ 提示词调试。 调试针对个案定位原因;评测对一组样本做整体比较,回答的是「这次改动是否普遍变好」。
提示词评测 ≠ 评测集。 评测集是跑评测用的那份题;提示词评测还包括判分方式(规则、模型裁判、人工)与对比口径。
真实例子
客服团队比较工单分流提示词 v7 与 v8,可以准备 120 条已脱敏历史工单,检查路由标签是否精确匹配,并用量规评价升级理由,同时记录延迟和成本。团队先在训练用样本上调整,再用未参与修改的保留集决定发布;即使 v8 的平均分更高,只要高风险退款工单的漏判超过阈值,也不能上线。
什么时候适合与不适合
提示词评测适合会重复运行、质量影响较大或需要多人持续改进的任务。一次性的低风险探索未必值得建设完整评测集。数据标注、评分器校准和运行都会增加成本,量规偏差也会被固化成分数。任何得分只对当时的数据集、标准、评分器与运行配置有效,不能被解释为模型在所有场景下的能力。[S1][S2]
亲自试一下
为一个常用提示词准备 12 条测试:6 条典型输入、3 条边界输入和 3 条已知失败输入。定义一个可自动检查的指标和一个带等级说明的人工指标,然后让版本 A、B 各运行全部样本。只有 24 次结果都有记录,并且你能预先写出“关键失败不得增加、总分至少提升多少”的发布阈值,这次评测才算通过。
接下来学什么
用评测集组织代表性样本,再用评测量规把主观标准变成一致判断;如果输入经常过长或关键信息被截断,继续学习上下文窗口定位评测失败的输入条件。
来源与修订
目标、代表性样本、评分器组合和持续评测参考 OpenAI 评测最佳实践 [S1];成功标准、测试构造与评分方式的取舍参考 Anthropic 测试与评测指南 [S2]。具体评测平台、模型评分能力、API 与产品生命周期会持续变化。
Learning questions
这个概念出现在哪些题里
下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。
Learning navigation
学习导航
沿认知链路:你现在在第 7 站,下一站是「给安全 · 什么时候必须有人管」:先沿主路径补上这一层。
Relation topology
基础定义单元 · 暂无直接强依赖关系
「提示词评测」在当前知识体系中作为底层基准概念建立,不直接依赖其它前置概念,亦未设定强约束关联。读者可直接阅读正文理解其内涵,或前往全网概念图谱探索整体领域架构。
Source register
核验来源
- Evaluation best practicesOpenAI · 访问于 2026-07-30
- Define success criteria and build evaluationsAnthropic · 访问于 2026-07-30
发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30