實務重點:標準化(scaling)
回顧影片內容,當各個特徵的分佈不同時,進行分群前可能需要先對特徵做「標準化(scaling)」。到目前為止,你在本章使用的都是不需要標準化的合成資料。
在這個練習中,你會回到「真實」資料,也就是第 1 章介紹過的 pokemon 資料集。你將觀察每個特徵的分佈(平均數與標準差),依此對資料進行標準化,接著使用 complete linkage 方法建立階層式分群模型。
本練習屬於課程
R 的無監督式學習
練習說明
資料已存放在工作環境中的 pokemon 物件。
- 使用
colMeans()函式觀察pokemon中每個變數的平均數。 - 使用
apply()與sd()函式觀察每個變數的標準差。由於變數在矩陣的欄上,請將apply()的MARGIN參數設為 2。 - 使用
scale()對pokemon資料進行標準化,並將結果儲存為pokemon.scaled。 - 以 complete linkage 方法,對
pokemon.scaled資料建立階層式分群模型。請手動指定method參數,並將結果儲存為hclust.pokemon。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon