始める無料で始める

K-means クラスタリング:最初の演習

この演習では、データセットに対する k-means クラスタリングの使い方に慣れていきます。Comic Con のデータセットを使って、k-means クラスタリングがどのように動作するかを確認しましょう。

k-means クラスタリングの2つのステップを思い出してください。

  • kmeans() 関数でクラスタ中心を定義します。必須引数は「観測データ」と「クラスタ数」の2つです。
  • vq() 関数でクラスタラベルを割り当てます。必須引数は「観測データ」と「クラスタ中心」の2つです。

データは pandas の DataFrame comic_con に格納されています。x_scaledy_scaled は、ある時点での人々の X・Y 座標を標準化した列名です。

この演習はコースの一部です

Pythonで学ぶクラスタ分析

コースを見る

演習の手順

  • SciPy から kmeansvq 関数をインポートします。
  • kmeans() 関数でクラスタ数を2としてクラスタ中心を生成します。
  • そのクラスタ中心を使ってクラスタラベルを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
コードを編集して実行