层次凝聚聚类
在上一个练习中,您看到在执行 K-means 聚类时,聚类数会影响结果,这有助于您在机器学习面试中讨论 K-means。然而,您还可以使用另一种聚类模型:层次凝聚聚类。在 Python 中,您可以通过可视化和数学两种方式推导该方法的最优聚类数。您将使用 scipy 和 sklearn 模块来完成这两种方法。
回顾一下,从树状图选择最优聚类数取决于链接准则和距离阈值。在这里,您将使用来自 diabetes 的 X 矩阵创建一个树状图,然后在高度 1.50 处画一条虚线,统计与之相交的垂直线段数量,用于表示接下来层次聚类算法的最优聚类数。
本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import hierarchical clustering libraries
import ____.____.____ as sch
from ____.____ import ____