始める無料で始める

k-means クラスタリングでセグメンテーションを構築する

この演習では、KMeans アルゴリズムを使って顧客セグメンテーションを構築します。前のステップで確認したとおり、数学的に最適なクラスタ数は 3 から 4 のあたりでした。ここでは、4 セグメントで構築します。

前処理済みデータセットは wholesale_scaled_df として読み込まれています。これを使って KMeans アルゴリズムを実行します。未加工の生データセットは wholesale として用意されており、後で作成した 4 セグメントごとの列の平均値を確認するのに使います。

この演習はコースの一部です

Pythonで学ぶマーケティングのための機械学習

コースを見る

演習の手順

  • sklearn.cluster モジュールから KMeans アルゴリズムをインポートします。
  • クラスタ数を 4、random_state を 123 に設定して KMeans を初期化します。
  • 前処理済みの wholesale_scaled_df データセットでモデルを学習(fit)します。
  • 生成されたラベルを生データの wholesale に新しい列 segment として割り当てます

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import `KMeans` module
from sklearn.cluster import ___

# Initialize `KMeans` with 4 clusters
kmeans=KMeans(___=4, random_state=123)

# Fit the model on the pre-processed dataset
kmeans.fit(___)

# Assign the generated labels to a new column
wholesale_kmeans4 = wholesale.assign(segment = kmeans.___)
コードを編集して実行