始める無料で始める

標準化

正規化は、列を2つの基準点の間にスケーリングするのに便利ですが、どちらか一方でも外れ値の影響を強く受けていると、スケーリング後の2つの列を比較するのは難しくなります。これに対する一般的な解決策が標準化です。標準化では厳密な上下限を設ける代わりに、データを平均値の周りに中心化し、各データ点が平均から何標準偏差離れているかを計算します。

この演習はコースの一部です

Python で学ぶ Machine Learning のための特徴量エンジニアリング

コースを見る

演習の手順

  • sklearnpreprocessing モジュールから StandardScaler をインポートします。
  • StandardScaler()SS_scaler としてインスタンス化します。
  • so_numeric_dfAge 列に対して StandardScaler を fit します。
  • 直前に fit したスケーラーで同じ列を transform します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
コードを編集して実行