始める無料で始める

クラスタリングのための魚データのスケーリング

魚の計測値を表す配列 samples が与えられています。各行は1匹の魚に対応します。重さ(グラム)、長さ(センチメートル)、高さと長さの比率(パーセンテージ)など、特徴量ごとにスケールが大きく異なります。このデータを効果的にクラスタリングするには、まずこれらの特徴量を標準化する必要があります。この演習では、標準化とクラスタリングを行うパイプラインを構築します。

この魚の計測データは、Journal of Statistics Education から取得されています。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • 次をインポートします:
    • sklearn.pipeline から make_pipeline
    • sklearn.preprocessing から StandardScaler
    • sklearn.cluster から KMeans
  • StandardScaler のインスタンス scaler を作成します。
  • クラスタ数を 4 にした KMeans のインスタンス kmeans を作成します。
  • scalerkmeans を連結したパイプライン pipeline を作成します。これには、make_pipeline() にそれらを引数として渡すだけで大丈夫です。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create scaler: scaler
scaler = ____

# Create KMeans instance: kmeans
kmeans = ____

# Create pipeline: pipeline
pipeline = ____
コードを編集して実行