Xây dựng phân khúc bằng phân cụm k-means
Trong bài tập này, bạn sẽ xây dựng phân khúc khách hàng bằng thuật toán KMeans. Như bạn đã xác định ở bước trước, số cụm tối ưu theo toán học nằm khoảng 3 đến 4. Ở đây, bạn sẽ xây dựng mô hình với 4 phân khúc.
Bộ dữ liệu đã tiền xử lý đã được nạp dưới tên wholesale_scaled_df. Bạn sẽ dùng nó để chạy thuật toán KMeans, và bộ dữ liệu thô chưa xử lý là wholesale — bạn sẽ dùng bộ này sau để khám phá giá trị trung bình theo cột cho 4 phân khúc bạn tạo ra.
Bài tập này là một phần của khóa học
Machine Learning cho Marketing với Python
Hướng dẫn bài tập
- Import thuật toán
KMeanstừ modulesklearn.cluster. - Khởi tạo thuật toán
KMeansvới 4 cụm vàrandom_stateđặt là 123. - Fit mô hình trên bộ dữ liệu đã tiền xử lý
wholesale_scaled_df. - Gán các nhãn sinh ra vào một cột mới tên
segmenttrong bộ dữ liệu thôwholesale
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import `KMeans` module
from sklearn.cluster import ___
# Initialize `KMeans` with 4 clusters
kmeans=KMeans(___=4, random_state=123)
# Fit the model on the pre-processed dataset
kmeans.fit(___)
# Assign the generated labels to a new column
wholesale_kmeans4 = wholesale.assign(segment = kmeans.___)