开始使用免费开始使用

选择簇的数量

在本练习中,您将把层次聚类模型的输出与实际诊断结果进行对比。通常在执行这种「无监督」学习时,是没有目标变量可用的。但在此数据集中我们有该变量,因此可以用来检查聚类模型的表现。

当进行「有监督」学习时——也就是您要预测某个感兴趣的目标变量,且该目标变量在原始数据中可用——使用聚类来创建新特征未必一定能提升最终模型的性能。本练习将帮助您判断在这个案例中,层次聚类是否能提供一个有价值的新特征。

本练习是课程的一部分

R 中的无监督学习

查看课程

练习说明

wisc.datadiagnosiswisc.prpvewisc.hclust 已在您的工作区中可用。

  • 使用 cutree() 将树剪成 4 个簇。把输出赋给变量 wisc.hclust.clusters
  • 使用 table() 函数,将簇归属与实际诊断结果进行对比。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
编辑并运行代码