k-means 聚类与结果比较
正如您现在所知,聚类主要有两种类型:层次聚类和 k-means 聚类。
在本练习中,您将基于 Wisconsin 乳腺癌数据构建一个 k-means 聚类模型,并将其结果与真实诊断以及您之前的层次聚类模型进行比较。请花些时间观察:每个聚类模型在区分两种诊断方面的表现如何,以及两个聚类模型之间的对照情况。
本练习是课程的一部分
R 中的无监督学习
练习说明
wisc.data、diagnosis 和 wisc.hclust.clusters 仍可用。
- 在
wisc.data上创建一个 k-means 模型,将结果赋给wisc.km。请确保将聚类数设为 2,以对应实际的诊断类别数量。此外,请记得对数据进行标准化,并将算法重复运行 20 次以找到表现较好的模型。 - 使用
table()函数,将 k-means 模型的簇成员关系与diagnosis向量中的真实诊断进行比较。思考:k-means 在区分两种诊断方面表现如何? - 使用
table()函数,将 k-means 模型的簇成员关系与层次聚类模型进行比较。回忆一下,层次聚类模型的簇成员关系保存在wisc.hclust.clusters中。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering