魚のデータをクラスタリングする
前の演習で作成した標準化とクラスタリングのパイプラインを使って、魚のデータをクラスタリングしましょう。そのうえで、クラスターのラベルと魚の種類を比較するクロス集計表を作成します。
これまでと同様に、samplesは魚の測定値を格納した二次元配列です。パイプラインはpipelineとして、各サンプルの魚の種類はリストspeciesとして、それぞれ用意されています。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートしてください。- パイプラインを魚の測定データ
samplesにフィットさせてください。 pipelineの.predict()メソッドを使って、samplesのクラスターラベルを取得してください。pd.DataFrame()を使って、'labels'と'species'という2つの列を持つデータフレームdfを作成してください。それぞれの列の値にはlabelsとspeciesを使用します。pd.crosstab()を使って、df['labels']とdf['species']のクロス集計表ctを作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)