K-means clustering: перша вправа
У цій вправі ви познайомитеся з використанням кластеризації k-means на наборі даних. Скористаймося набором даних Comic Con і перевірмо, як на ньому працює кластеризація k-means.
Згадайте два кроки кластеризації k-means:
- Визначення центрів кластерів за допомогою функції
kmeans(). Вона має два обов'язкові аргументи: спостереження та кількість кластерів. - Призначення міток кластерів за допомогою функції
vq(). Вона має два обов'язкові аргументи: спостереження та центри кластерів.
Дані збережено в датафреймі pandas comic_con. x_scaled та y_scaled — це назви стовпців зі стандартизованими координатами X і Y людей у певний момент часу.
Ця вправа є частиною курсу
Кластерний аналіз у Python
Інструкції до вправи
- Імпортуйте функції
kmeansіvqу SciPy. - Згенеруйте центри кластерів за допомогою функції
kmeans()із двома кластерами. - Створіть мітки кластерів, використавши ці центри кластерів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()