НачатьНачать бесплатно

K-means кластеризация: первое упражнение

В этом упражнении вы познакомитесь с применением k-means кластеризации на реальных данных. Используем набор данных Comic Con и посмотрим, как работает этот алгоритм.

Вспомним два шага k-means кластеризации:

  • Определить центры кластеров с помощью функции kmeans(). Она принимает два обязательных аргумента: наблюдения и количество кластеров.
  • Назначить метки кластеров с помощью функции vq(). Она также принимает два обязательных аргумента: наблюдения и центры кластеров.

Данные хранятся в DataFrame библиотеки pandas — comic_con. Столбцы x_scaled и y_scaled содержат стандартизированные координаты X и Y людей в определённый момент времени.

Это упражнение является частью курса

Кластерный анализ на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функции kmeans и vq из SciPy.
  • Сгенерируйте центры кластеров с помощью функции kmeans(), задав два кластера.
  • Создайте метки кластеров на основе полученных центров.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Редактировать и запускать код