k-means クラスタリングでセグメンテーションを構築する
この演習では、KMeans アルゴリズムを使って顧客セグメンテーションを構築します。前のステップで確認したとおり、数学的に最適なクラスタ数は 3 から 4 のあたりでした。ここでは、4 セグメントで構築します。
前処理済みデータセットは wholesale_scaled_df として読み込まれています。これを使って KMeans アルゴリズムを実行します。未加工の生データセットは wholesale として用意されており、後で作成した 4 セグメントごとの列の平均値を確認するのに使います。
この演習はコースの一部です
Pythonで学ぶマーケティングのための機械学習
演習の手順
sklearn.clusterモジュールからKMeansアルゴリズムをインポートします。- クラスタ数を 4、random_state を 123 に設定して
KMeansを初期化します。 - 前処理済みの
wholesale_scaled_dfデータセットでモデルを学習(fit)します。 - 生成されたラベルを生データの
wholesaleに新しい列segmentとして割り当てます
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import `KMeans` module
from sklearn.cluster import ___
# Initialize `KMeans` with 4 clusters
kmeans=KMeans(___=4, random_state=123)
# Fit the model on the pre-processed dataset
kmeans.fit(___)
# Assign the generated labels to a new column
wholesale_kmeans4 = wholesale.assign(segment = kmeans.___)