选择簇的数量
在本练习中,您将把层次聚类模型的输出与实际诊断结果进行对比。通常在执行这种「无监督」学习时,是没有目标变量可用的。但在此数据集中我们有该变量,因此可以用来检查聚类模型的表现。
当进行「有监督」学习时——也就是您要预测某个感兴趣的目标变量,且该目标变量在原始数据中可用——使用聚类来创建新特征未必一定能提升最终模型的性能。本练习将帮助您判断在这个案例中,层次聚类是否能提供一个有价值的新特征。
本练习是课程的一部分
R 中的无监督学习
练习说明
wisc.data、diagnosis、wisc.pr、pve 和 wisc.hclust 已在您的工作区中可用。
- 使用
cutree()将树剪成 4 个簇。把输出赋给变量wisc.hclust.clusters。 - 使用
table()函数,将簇归属与实际诊断结果进行对比。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses