Построение сегментации с помощью кластеризации k-средних
В этом упражнении вы построите сегментацию клиентов с помощью алгоритма KMeans. Как вы определили на предыдущем шаге, математически оптимальное число кластеров находится в районе 3–4. Здесь вы построите модель с 4 сегментами.
Предобработанный набор данных загружен как wholesale_scaled_df. Вы будете использовать его для запуска алгоритма KMeans, а исходный необработанный набор данных доступен как wholesale — он понадобится вам позже для изучения средних значений по столбцам для каждого из 4 построенных сегментов.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Импортируйте алгоритм
KMeansиз модуляsklearn.cluster. - Инициализируйте алгоритм
KMeansс 4 кластерами и фиксированным состоянием генератора случайных чисел, равным 123. - Обучите модель на предобработанном наборе данных
wholesale_scaled_df. - Присвойте сгенерированные метки новому столбцу
segmentв исходном наборе данныхwholesale.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import `KMeans` module
from sklearn.cluster import ___
# Initialize `KMeans` with 4 clusters
kmeans=KMeans(___=4, random_state=123)
# Fit the model on the pre-processed dataset
kmeans.fit(___)
# Assign the generated labels to a new column
wholesale_kmeans4 = wholesale.assign(segment = kmeans.___)