НачатьНачать бесплатно

Иерархическая кластеризация: метод Уорда

Пришло время Comic-Con! Comic-Con — ежегодный фестиваль комиксов, который проводится в крупных городах мира. У вас есть данные о посещаемости прошлого года: количество людей на территории мероприятия в каждый момент времени. Вы хотите выбрать место для своего стенда так, чтобы максимизировать продажи. Применив иерархическую кластеризацию методом Уорда, найдите две точки притяжения посетителей в этой зоне.

Данные хранятся в DataFrame библиотеки pandas — comic_con. Столбцы x_scaled и y_scaled содержат стандартизированные координаты X и Y людей в заданный момент времени.

Это упражнение является частью курса

Кластерный анализ на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте fcluster и linkage из scipy.cluster.hierarchy.
  • Используйте метод ward в функции linkage().
  • Назначьте метки кластеров, сформировав 2 плоских кластера из distance_matrix.
  • Запустите код построения графика, чтобы увидеть результаты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the fcluster and linkage functions
from scipy.cluster.hierarchy import ____, ____

# Use the linkage() function
distance_matrix = ____(comic_con[['x_scaled', 'y_scaled']], ____ = ____, metric = 'euclidean')

# Assign cluster labels
comic_con['cluster_labels'] = ____(____, ____, criterion='maxclust')

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Редактировать и запускать код