实践要点:缩放
请回忆视频中的内容:当各特征的分布不同,聚类真实数据时可能需要对特征进行"缩放"(scaling)。在本章目前为止的练习中,您一直使用的是不需要缩放的合成数据。
在本练习中,您将回到"真实"数据——第一章介绍过的 pokemon 数据集。您将先观察各特征的分布(均值与标准差),据此对数据进行缩放,然后使用 complete linkage(完全链接)方法构建一个层次聚类模型。
本练习是课程的一部分
R 中的无监督学习
练习说明
数据已存放在工作区中的 pokemon 对象里。
- 使用
colMeans()函数查看pokemon中每个变量的均值。 - 使用
apply()和sd()函数查看每个变量的标准差。由于变量对应矩阵的列,请将apply()的MARGIN参数设为 2。 - 使用
scale()函数对pokemon数据进行缩放,并将结果保存到pokemon.scaled。 - 使用 complete linkage 方法对
pokemon.scaled数据创建层次聚类模型。请手动指定method参数,并将结果保存到hclust.pokemon。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon