案例数据的层次聚类
本练习的目标是对观测值进行层次聚类。回顾第 2 章,这类聚类不会事先假设数据中存在的自然分组数量。
在进行层次聚类的准备过程中,需要计算所有观测值两两之间的距离。此外,连接簇有多种方式,最常见的连接方法包括 single(最短距离)、complete(最长距离)和 average(平均距离)。
本练习是课程的一部分
R 中的无监督学习
练习说明
您之前创建的变量 wisc.data、diagnosis、wisc.pr 和 pve 已在您的工作区可用。
- 对
wisc.data进行标准化,并将结果保存到data.scaled。 - 在新的标准化数据集中,计算所有观测值两两之间的(欧几里得)距离,并将结果保存到
data.dist。 - 使用 complete linkage 创建层次聚类模型。手动为
hclust()指定method参数,并将结果保存到wisc.hclust。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Scale the wisc.data data: data.scaled
# Calculate the (Euclidean) distances: data.dist
# Create a hierarchical clustering model: wisc.hclust