始める無料で始める

データのスケーリング

距離に基づく指標を使う ML アルゴリズムでは、特徴量のスケールが異なると結果が歪むため、データをスケーリングすることが重要です。K-means はクラスタ重心までの距離を評価するのにユークリッド距離を使用するため、アルゴリズムを実装する前にデータをスケーリングする必要があります。まずはそこから進めましょう。

前の演習で作成したデータフレーム df が用意されています。sklearn で使えるように、いくつかの前処理は済んでいます。不正ラベルは labels に別で保存されているので、後で結果の確認に使えます。numpynp としてインポート済みです。

この演習はコースの一部です

Pythonで学ぶ不正検知

コースを見る

演習の手順

  • MinMaxScaler をインポートしてください。
  • データフレーム df の値のみを取り出して numpy 配列 X に変換し、すべての値が float になるようにしてください。
  • 定義したスケーラーを X に適用して、すべての特徴量が 0〜1 のスケールになるようにスケーリングされた X_scaled を得てください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
コードを編集して実行