上图显示的是您先前计算的谷物样本层次聚类的树状图。如果在该树状图的高度 6 处停止层次聚类,会得到多少个簇?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
学习如何发现数据集中的潜在分组(即"聚类")。在本章结束时,您将基于股票价格对公司进行聚类,并通过聚类度量来区分不同物种。
本章将介绍两种用于数据可视化的无监督学习技术:层次聚类与 t-SNE。层次聚类把数据样本不断合并为更粗的簇,并生成表示簇层级关系的树状可视化。t-SNE 将数据样本映射到 2 维空间,从而可以直观展示样本之间的相互接近程度。
当前练习
降维通过提取常见模式来概括数据集。在本章中,您将学习最基础的降维技术——"主成分分析"("PCA")。PCA 常用于有监督学习之前,以提升模型性能与泛化能力。它对无监督学习同样有用。例如,您将使用一种 PCA 的变体,根据内容对 Wikipedia 文章进行聚类!
本章将介绍一种名为"非负矩阵分解"("NMF")的降维技术,它把样本表示为可解释部分的组合。例如,可将文档表示为主题的组合,将图像表示为常见的视觉模式。您还将学习使用 NMF 构建推荐系统,为您发现相似的可阅读文章,或与您的收听历史相匹配的音乐艺术家!