クラスタリングのための魚のデータ標準化
魚の測定データを格納した配列samplesがあります。各行は1匹の魚を表しています。重さ(グラム)、長さ(センチメートル)、身長に対する体高の割合(パーセント)といった測定値は、それぞれスケールが大きく異なります。このデータを効果的にクラスタリングするには、まずこれらの特徴量を標準化する必要があります。この演習では、データを標準化してクラスタリングするパイプラインを構築します。
この魚の測定データはJournal of Statistics Education から取得したものです。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
- 次のモジュールをインポートしてください。
sklearn.pipelineからmake_pipelinesklearn.preprocessingからStandardScalersklearn.clusterからKMeans
StandardScalerのインスタンスを作成し、scalerという名前を付けてください。- クラスタ数
4を指定したKMeansのインスタンスを作成し、kmeansという名前を付けてください。 scalerとkmeansを連結したパイプラインを作成し、pipelineという名前を付けてください。これには、make_pipeline()にこれらを引数として渡すだけで構いません。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create scaler: scaler
scaler = ____
# Create KMeans instance: kmeans
kmeans = ____
# Create pipeline: pipeline
pipeline = ____