始める無料で始める

魚のデータをクラスタリングする

前の演習で作成した標準化とクラスタリングのパイプラインを使って、魚のデータをクラスタリングしましょう。そのうえで、クラスターのラベルと魚の種類を比較するクロス集計表を作成します。

これまでと同様に、samplesは魚の測定値を格納した二次元配列です。パイプラインはpipelineとして、各サンプルの魚の種類はリストspeciesとして、それぞれ用意されています。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • pandaspdとしてインポートしてください。
  • パイプラインを魚の測定データsamplesにフィットさせてください。
  • pipeline.predict()メソッドを使って、samplesのクラスターラベルを取得してください。
  • pd.DataFrame()を使って、'labels''species'という2つの列を持つデータフレームdfを作成してください。それぞれの列の値にはlabelsspeciesを使用します。
  • pd.crosstab()を使って、df['labels']df['species']のクロス集計表ctを作成してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import pandas
import pandas as pd

# Fit the pipeline to samples
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame with labels and species as columns: df
df = ____

# Create crosstab: ct
ct = ____

# Display ct
print(ct)
コードを編集して実行