НачатьНачать бесплатно

Построение сегментации с помощью кластеризации k-средних

В этом упражнении вы построите сегментацию клиентов с помощью алгоритма KMeans. Как вы определили на предыдущем шаге, математически оптимальное число кластеров находится в районе 3–4. Здесь вы построите модель с 4 сегментами.

Предобработанный набор данных загружен как wholesale_scaled_df. Вы будете использовать его для запуска алгоритма KMeans, а исходный необработанный набор данных доступен как wholesale — он понадобится вам позже для изучения средних значений по столбцам для каждого из 4 построенных сегментов.

Это упражнение является частью курса

Машинное обучение для маркетинга на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте алгоритм KMeans из модуля sklearn.cluster.
  • Инициализируйте алгоритм KMeans с 4 кластерами и фиксированным состоянием генератора случайных чисел, равным 123.
  • Обучите модель на предобработанном наборе данных wholesale_scaled_df.
  • Присвойте сгенерированные метки новому столбцу segment в исходном наборе данных wholesale.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import `KMeans` module
from sklearn.cluster import ___

# Initialize `KMeans` with 4 clusters
kmeans=KMeans(___=4, random_state=123)

# Fit the model on the pre-processed dataset
kmeans.fit(___)

# Assign the generated labels to a new column
wholesale_kmeans4 = wholesale.assign(segment = kmeans.___)
Редактировать и запускать код