開始使用免費開始

實務重點:標準化(scaling)

回顧影片內容,當各個特徵的分佈不同時,進行分群前可能需要先對特徵做「標準化(scaling)」。到目前為止,你在本章使用的都是不需要標準化的合成資料。

在這個練習中,你會回到「真實」資料,也就是第 1 章介紹過的 pokemon 資料集。你將觀察每個特徵的分佈(平均數與標準差),依此對資料進行標準化,接著使用 complete linkage 方法建立階層式分群模型。

本練習屬於課程

R 的無監督式學習

檢視課程

練習說明

資料已存放在工作環境中的 pokemon 物件。

  • 使用 colMeans() 函式觀察 pokemon 中每個變數的平均數。
  • 使用 apply()sd() 函式觀察每個變數的標準差。由於變數在矩陣的欄上,請將 apply()MARGIN 參數設為 2。
  • 使用 scale()pokemon 資料進行標準化,並將結果儲存為 pokemon.scaled
  • 以 complete linkage 方法,對 pokemon.scaled 資料建立階層式分群模型。請手動指定 method 參數,並將結果儲存為 hclust.pokemon

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# View column means


# View column standard deviations


# Scale the data


# Create hierarchical clustering model: hclust.pokemon
編輯並執行程式碼