机器学习与深度学习入门已弃用核验于 2026-07-29

无监督学习

Unsupervised Learning

在没有明确目标标签的数据中发现结构、分组或表示规律的机器学习方法。

本页目录
快速跳转

它是什么

无监督学习是在没有预先给定目标答案的数据中寻找结构、分组或有用表示的方法。它不是“模型完全不受人影响”:人仍要选择数据、特征、相似度、算法和评价方式,这些选择都会改变结果。[S1][S2]

为什么需要它

现实中的数据常常很多,却没有逐条标签。团队可能想先了解客户反馈里有哪些主题、商品之间有哪些相似群组,或高维数据能否压缩成更容易处理的表示。无监督学习可以帮助探索这些未知结构,为后续分析、标注或监督任务提供线索。

它如何工作

先把样本表示成可以比较的特征,再定义什么算“相似”或什么结构值得保留。聚类方法会把相近样本组织在一起;表示学习则尝试把原始输入变成更适合后续任务的内部表示。[S1][S2] 因为没有标准答案直接对照,结果通常要通过稳定性、业务可解释性或后续任务表现来检验。

真实例子

产品团队有数千条未分类的用户反馈,可以先把语义相近的反馈聚成若干组。算法可能分出“登录问题”“价格疑问”和“功能请求”,但这些名称不是模型自带的答案,而是研究者阅读样本后给出的解释。同一批反馈换一种表示或聚类数量,分组也可能改变。

什么时候适合与不适合

适合缺少标签、目标是探索结构或学习表示的场景,优势是能利用大量未标注数据。前提是团队能定义有意义的相似性并对结果进行外部验证。不适合把分组直接当作客观人群类型或最终业务结论;结果可能难以命名、对参数敏感,也可能把数据中的偏差包装成看似自然的群组。

亲自试一下

目标是观察“相似”的定义如何改变分组。找 15 条短文本,先按关键词重合分组,再按你理解的真实意图重新分组;给每组命名,并挑出最难归类的三条。若两次结果差异很大,就写明哪一种更适合当前任务,以及需要什么外部证据才能确认这些组确实有用。

接下来学什么

继续学习聚类理解典型分组方法,再学习神经网络和Embedding如何构造内部表示;若已经有可靠标签,则回到监督学习建立可直接评估的任务。

来源与修订

无监督学习与聚类的基础区分参考 Google 机器学习导论 [S1];表示学习、无标签数据用途及其任务依赖边界参考 MIT Press《Deep Learning》表示学习章节 [S2]。本文不把聚类当作无监督学习的全部范围。

Learning navigation

学习导航

同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。

Source register

核验来源

  1. What is Machine Learning?Google for Developers · 访问于 2026-07-29
  2. Deep Learning: Representation LearningMIT Press · 访问于 2026-07-29

发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29