机器学习与深度学习入门已核验核验于 2026-07-29

分类任务

Classification

将输入判断为一个或多个离散类别的预测任务,例如垃圾邮件识别或意图分类。

本页目录
快速跳转

它是什么

分类任务是让模型把输入判断为一个或多个离散类别。只有两个互斥类别时是二分类,例如“垃圾邮件/正常邮件”;从多个互斥类别中选择时是多分类,例如识别数字 0 到 9;一个样本可以同时属于多个类别时,则是多标签分类。[S1][S2]

为什么需要它

很多业务动作首先需要做类别判断:工单应该进入哪个队列、交易是否需要复核、图片包含哪些对象。分类把这种判断变成可以训练和评估的任务,使团队能分别统计不同错误,而不是只说模型“看起来挺准”。

它如何工作

模型根据输入特征产生每个类别的分数或概率,再通过选择规则给出标签。二分类常用阈值把概率转成正类或负类;提高阈值通常会减少正类预测,同时改变误报和漏报的数量。[S1] 多分类可以选择分数最高的类别,多标签则可为每个类别分别判断。最终仍要把预测与真实标签对照,并按任务选择准确率、精确率、召回率等指标。

必须澄清的误会

分类任务 ≠ 回归任务。 分类的输出是类别,回归的输出是连续数值。预测房价用回归,判断会不会涨价用分类。

分类任务 ≠ 聚类。 分类的类别是人事先定好的,聚类是让算法自己找分组;前者需要标注数据,后者不需要。

真实例子

客服团队要识别“必须两小时内处理”的紧急工单。模型输出紧急概率后,若把阈值设得很低,会捕获更多真正紧急的工单,也会让更多普通工单进入加急队列;阈值太高则相反。团队需要比较漏掉紧急事件和误占人工资源的代价,再决定阈值,而不是默认使用 0.5。

什么时候适合与不适合

适合类别边界能够定义、标签可以稳定复核、预测结果会触发明确动作的任务。分类结果便于接入流程,但类别不平衡时,高准确率可能只是模型总在猜多数类;标签含义变化、类别彼此重叠或错误代价未定义时,单个分数也难以说明模型是否可用。若目标本质上是金额、时间等连续数值,应先考虑回归任务。

亲自试一下

目标是让评价标准对应真实后果。选一个二分类场景,列出真阳性、假阳性、真阴性和假阴性各一个具体结果,再为两类错误分别标注影响。若无法判断哪类错误更重要,就先补充业务决策;若某类样本极少,则记录为什么准确率不足以单独验收。

接下来学什么

先回顾监督学习理解标签如何参与训练,再与回归任务比较输出类型;随后学习AI 评估选择指标,并用泛化能力检查分类器面对新样本时是否仍有效。

来源与修订

二分类、多分类、阈值和指标取舍参考 Google 分类课程 [S1];分类作为监督学习任务及其泛化背景参考 MIT Press《Deep Learning》机器学习基础章节 [S2]。本文不把任一阈值或指标写成跨场景的固定答案。

Learning questions

这个概念出现在哪些题里

下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。

Case practice

这个概念出现在哪些案例里

案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。

Learning navigation

学习导航

沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

🌱 独立基准概念

基础定义单元 · 暂无直接强依赖关系

「分类任务」在当前知识体系中作为底层基准概念建立,不直接依赖其它前置概念,亦未设定强约束关联。读者可直接阅读正文理解其内涵,或前往全网概念图谱探索整体领域架构。

Source register

核验来源

  1. ClassificationGoogle for Developers · 访问于 2026-07-29
  2. Deep Learning: Machine Learning BasicsMIT Press · 访问于 2026-07-29

发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29