它是什么
模型能力是模型在指定任务或场景、输入、提示与运行配置和评价指标下表现出的可测能力。例如“在这组中文客服工单上按既定标签分类”是一项可测能力,“很聪明”不是。能力描述必须附带条件,因为同一模型会随语言、输入长度、提示方式、工具和采样设置产生不同结果。HELM 与 OpenAI 的评测实践都强调场景、样本、指标和配置。[S1][S2]
为什么需要它
产品团队选择模型时,容易依赖供应商介绍、通用排行榜或几个顺手样例。这些信息不能回答模型是否适合自己的任务,也可能掩盖关键失败、成本和延迟。把能力写成可测命题,团队才能比较候选模型、发现取舍、建立升级回归测试,并避免把单项优势外推到整个产品系统。
它如何工作
先定义任务输入、期望输出和不能接受的失败,再收集覆盖典型、边界与对抗情况的代表性样本。固定提示、工具、温度、输出格式和模型版本,选择与任务相关的准确性、校准、稳健性、公平性、延迟或成本指标,运行候选模型并逐类分析。自动评分器要用人工判断校准,评测集还应持续吸收生产失败。多指标结果用于看取舍,而不是合成一个脱离情境的万能分数。[S1][S2]
必须澄清的误会
模型能力 ≠ AI 能力边界。 能力边界讲的是整类 AI 做不到什么(例如无法保证事实正确);模型能力讲某个具体模型在基准与实测中的表现,两者是类别与个体的关系。
模型能力 ≠ 基准测试。 基准测试是测量手段,模型能力是被测对象,而且基准分数只覆盖它的其中一部分。
真实例子
团队比较两个模型处理中文客服工单。模型 A 总体分类正确率为 92%,但在涉及退款期限的长工单上经常漏掉否定词;模型 B 总体为 90%,在高风险退款子集却更稳定,并且延迟更低。若产品目标优先避免错误退款,B 可能更合适。结论只能针对当前数据集、提示、版本和指标,不能写成“B 的语言能力更强”。
什么时候适合与不适合
模型选型、版本升级、路由和成本优化都需要能力评测。早期探索可以先用小型诊断集,但不能据此承诺生产效果。更大的评测集会增加标注与运行成本,公开基准也可能与真实任务分布不同。模型能力只是完整系统的一部分;检索数据、工具、界面、权限和人员流程仍可能让产品结果变好或变坏。[S1][S2]
亲自试一下
挑选一个模型能力命题,把它改写成“模型版本__在配置__下,对样本集__按指标__达到____”。准备 10 个典型、5 个边界和 5 个已知失败样本,固定配置运行两个候选模型。除了平均结果,再分别记录三个子集、延迟和成本;若排名因子集或指标而反转,就写出选择依据而不是宣布总冠军。
接下来学什么
先学习大语言模型理解被评估对象,再用AI 能力边界把模型结果放回完整系统情境;实际选型时继续学习离线评估和模型路由。
来源与修订
场景分类、多指标评测、标准化条件与覆盖局限参考 HELM [S1];明确目标、代表性样本、典型与边界案例、评分器校准和持续评测参考 OpenAI 评测最佳实践 [S2]。具体模型强项、版本、基准结果、提示配置和 API 会持续变化,评测结论必须注明版本与日期。
Learning questions
这个概念出现在哪些题里
下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。
Learning navigation
学习导航
沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。
Relation topology
基础定义单元 · 暂无直接强依赖关系
「模型能力」在当前知识体系中作为底层基准概念建立,不直接依赖其它前置概念,亦未设定强约束关联。读者可直接阅读正文理解其内涵,或前往全网概念图谱探索整体领域架构。
Source register
核验来源
- Holistic Evaluation of Language ModelsarXiv · 访问于 2026-07-30
- Evaluation best practicesOpenAI · 访问于 2026-07-30
发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30