始める無料で始める

魚データのクラスタリング

前の演習で作成した標準化とクラスタリングのパイプラインを使って、魚を計測値でクラスタリングし、クラスタラベルと魚種を比較するクロス集計を作成します。

これまでと同様に、samples は魚の計測値からなる2次元配列です。パイプラインは pipeline として利用可能で、各サンプルの魚種はリスト species に入っています。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • pandaspd としてインポートします。
  • samples(魚の計測値)にパイプラインを当てはめます。
  • pipeline.predict() メソッドを使って、samples のクラスタラベルを取得します。
  • pd.DataFrame() を使い、列名を 'labels''species' とする2列の DataFrame df を作成し、それぞれの列の値に labelsspecies を用います。
  • pd.crosstab() を使い、df['labels']df['species'] のクロス集計 ct を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import pandas
import pandas as pd

# Fit the pipeline to samples
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame with labels and species as columns: df
df = ____

# Create crosstab: ct
ct = ____

# Display ct
print(ct)
コードを編集して実行