K-means кластеризация: первое упражнение
В этом упражнении вы познакомитесь с применением k-means кластеризации на реальных данных. Используем набор данных Comic Con и посмотрим, как работает этот алгоритм.
Вспомним два шага k-means кластеризации:
- Определить центры кластеров с помощью функции
kmeans(). Она принимает два обязательных аргумента: наблюдения и количество кластеров. - Назначить метки кластеров с помощью функции
vq(). Она также принимает два обязательных аргумента: наблюдения и центры кластеров.
Данные хранятся в DataFrame библиотеки pandas — comic_con. Столбцы x_scaled и y_scaled содержат стандартизированные координаты X и Y людей в определённый момент времени.
Это упражнение является частью курса
Кластерный анализ на Python
Инструкции к упражнению
- Импортируйте функции
kmeansиvqиз SciPy. - Сгенерируйте центры кластеров с помощью функции
kmeans(), задав два кластера. - Создайте метки кластеров на основе полученных центров.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()