クラスタリングのための魚データのスケーリング
魚の計測値を表す配列 samples が与えられています。各行は1匹の魚に対応します。重さ(グラム)、長さ(センチメートル)、高さと長さの比率(パーセンテージ)など、特徴量ごとにスケールが大きく異なります。このデータを効果的にクラスタリングするには、まずこれらの特徴量を標準化する必要があります。この演習では、標準化とクラスタリングを行うパイプラインを構築します。
この魚の計測データは、Journal of Statistics Education から取得されています。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
- 次をインポートします:
sklearn.pipelineからmake_pipeline。sklearn.preprocessingからStandardScaler。sklearn.clusterからKMeans。
StandardScalerのインスタンスscalerを作成します。- クラスタ数を
4にしたKMeansのインスタンスkmeansを作成します。 scalerとkmeansを連結したパイプラインpipelineを作成します。これには、make_pipeline()にそれらを引数として渡すだけで大丈夫です。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create scaler: scaler
scaler = ____
# Create KMeans instance: kmeans
kmeans = ____
# Create pipeline: pipeline
pipeline = ____