or
本练习是课程的一部分
在能够对新闻文章进行分类之前,您需要先了解聚类的基础。本章将带您认识一类称为无监督学习的机器学习算法,并介绍其中广泛使用的聚类方法。您将了解两种常见的聚类技术:层次聚类和 k-means 聚类。最后,本章将以开始对数据进行聚类前所需的基本预处理步骤作为收尾。
本章聚焦一种常用的聚类算法——层次聚类——及其在 SciPy 中的实现。除讲解执行层次聚类的流程外,还将帮助您回答一个关键问题:数据中到底有多少个聚类?本章最后讨论层次聚类的局限性,并给出使用层次聚类时的注意事项。
当前练习
本章介绍另一种聚类算法——k-means 聚类——及其在 SciPy 中的实现。k-means 聚类克服了上一章提到的层次聚类的最大缺点。由于树状图是层次聚类特有的,本章将讨论在运行 k-means 聚类之前用于确定聚类数量的一种方法。最后,本章还将讨论 k-means 聚类的局限性,以及使用该算法时的相关考虑。
现在您已经熟悉两种最常见的聚类技术,本章将帮助您把所学应用到真实问题中。首先,我们将讲解在图像中寻找主色的过程,随后回到导言中的问题——对新闻文章进行聚类。最后,本章将讨论包含多变量的数据聚类,这会使完整可视化所有数据变得更加困难。