魚データのクラスタリング
前の演習で作成した標準化とクラスタリングのパイプラインを使って、魚を計測値でクラスタリングし、クラスタラベルと魚種を比較するクロス集計を作成します。
これまでと同様に、samples は魚の計測値からなる2次元配列です。パイプラインは pipeline として利用可能で、各サンプルの魚種はリスト species に入っています。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートします。samples(魚の計測値)にパイプラインを当てはめます。pipelineの.predict()メソッドを使って、samplesのクラスタラベルを取得します。pd.DataFrame()を使い、列名を'labels'と'species'とする2列の DataFramedfを作成し、それぞれの列の値にlabelsとspeciesを用います。pd.crosstab()を使い、df['labels']とdf['species']のクロス集計ctを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)