如果有 5 個資料樣本,在階層式叢集中會發生幾次合併操作?(要回答這題,可以回想影片中 Ben 示範以 6 個國家進行階層式叢集的例子。)
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
學習如何找出資料集中潛在的群組(或「叢集」)。在本章結束時,你會用股價資料對公司進行分群,並透過分群以量測資料來區分不同物種。
本章將介紹兩種用於資料視覺化的非監督式學習技術:階層式分群與 t-SNE。階層式分群會將資料樣本逐步合併為更粗的叢集,並以樹狀圖呈現得到的叢集階層。t-SNE 則把資料樣本映射到 2 維空間,讓樣本之間的相近關係能被視覺化。
當前練習
降維會以常見的出現模式來摘要一個資料集。在本章中,你將學習最基礎的降維技術——「主成分分析」(「PCA」)。PCA 常在監督式學習前使用,以提升模型效能與泛化能力;同樣也能用於非監督式學習。例如,你將運用一種 PCA 的變體,依內容對 Wikipedia 文章進行分群!
本章將介紹一種名為「非負矩陣分解」(「NMF」)的降維技術,能將樣本表達為可解釋部件的組合。例如,它能將文件表達為主題的組合,並以常見的視覺模式來表達影像。你也會學到如何使用 NMF 建立推薦系統,找出適合你閱讀的相似文章,或符合你收聽紀錄的音樂藝人!