k-means 分群與結果比較
你現在已知道分群主要有兩種:階層式與 k-means。
在這個練習中,你會在 Wisconsin 乳癌資料上建立 k-means 分群模型,並把結果與實際診斷,以及你先前的階層式分群模型結果做比較。花點時間觀察各分群模型在區分兩種診斷上的表現,以及兩個分群模型之間的差異。
本練習屬於課程
R 的無監督式學習
練習說明
wisc.data、diagnosis 與 wisc.hclust.clusters 仍可使用。
- 在
wisc.data上建立 k-means 模型,將結果指定給wisc.km。請建立 2 個叢集,對應實際的診斷數量。也別忘了先對資料做尺度調整,並將演算法重複執行 20 次以找到表現良好的模型。 - 使用
table()函式,將 k-means 模型的叢集成員資格與diagnosis向量中的實際診斷做比較。你覺得 k-means 在區分兩種診斷方面表現如何? - 使用
table()函式,將 k-means 模型的叢集成員資格與階層式分群模型比較。回想階層式分群模型的叢集成員資格在wisc.hclust.clusters。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering