K-means クラスタリング:最初の演習
この演習では、データセットに対する k-means クラスタリングの使い方に慣れていきます。Comic Con のデータセットを使って、k-means クラスタリングがどのように動作するかを確認しましょう。
k-means クラスタリングの2つのステップを思い出してください。
kmeans()関数でクラスタ中心を定義します。必須引数は「観測データ」と「クラスタ数」の2つです。vq()関数でクラスタラベルを割り当てます。必須引数は「観測データ」と「クラスタ中心」の2つです。
データは pandas の DataFrame comic_con に格納されています。x_scaled と y_scaled は、ある時点での人々の X・Y 座標を標準化した列名です。
この演習はコースの一部です
Pythonで学ぶクラスタ分析
演習の手順
- SciPy から
kmeansとvq関数をインポートします。 kmeans()関数でクラスタ数を2としてクラスタ中心を生成します。- そのクラスタ中心を使ってクラスタラベルを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()