Иерархическая кластеризация: метод Уорда
Пришло время Comic-Con! Comic-Con — ежегодный фестиваль комиксов, который проводится в крупных городах мира. У вас есть данные о посещаемости прошлого года: количество людей на территории мероприятия в каждый момент времени. Вы хотите выбрать место для своего стенда так, чтобы максимизировать продажи. Применив иерархическую кластеризацию методом Уорда, найдите две точки притяжения посетителей в этой зоне.
Данные хранятся в DataFrame библиотеки pandas — comic_con. Столбцы x_scaled и y_scaled содержат стандартизированные координаты X и Y людей в заданный момент времени.
Это упражнение является частью курса
Кластерный анализ на Python
Инструкции к упражнению
- Импортируйте
fclusterиlinkageизscipy.cluster.hierarchy. - Используйте метод
wardв функцииlinkage(). - Назначьте метки кластеров, сформировав 2 плоских кластера из
distance_matrix. - Запустите код построения графика, чтобы увидеть результаты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the fcluster and linkage functions
from scipy.cluster.hierarchy import ____, ____
# Use the linkage() function
distance_matrix = ____(comic_con[['x_scaled', 'y_scaled']], ____ = ____, metric = 'euclidean')
# Assign cluster labels
comic_con['cluster_labels'] = ____(____, ____, criterion='maxclust')
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()