開始使用免費開始

標準化

正規化能把欄位縮放到兩個界線之間,但如果其中一個欄位深受離群值影響,兩個已縮放的欄位就很難比較。常見的解法是「標準化」:不再設定嚴格的上下界,而是把資料以平均數為中心,並計算每個資料點距離平均數有多少個標準差。

本練習屬於課程

Feature Engineering for Machine Learning in Python

檢視課程

練習說明

  • sklearnpreprocessing 模組匯入 StandardScaler
  • StandardScaler() 具現化為 SS_scaler
  • so_numeric_dfAge 欄位上擬合 StandardScaler
  • 使用剛剛擬合好的 scaler 轉換同一個欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
編輯並執行程式碼