ПочатиПочніть безкоштовно

K-means clustering: перша вправа

У цій вправі ви познайомитеся з використанням кластеризації k-means на наборі даних. Скористаймося набором даних Comic Con і перевірмо, як на ньому працює кластеризація k-means.

Згадайте два кроки кластеризації k-means:

  • Визначення центрів кластерів за допомогою функції kmeans(). Вона має два обов'язкові аргументи: спостереження та кількість кластерів.
  • Призначення міток кластерів за допомогою функції vq(). Вона має два обов'язкові аргументи: спостереження та центри кластерів.

Дані збережено в датафреймі pandas comic_con. x_scaled та y_scaled — це назви стовпців зі стандартизованими координатами X і Y людей у певний момент часу.

Ця вправа є частиною курсу

Кластерний аналіз у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функції kmeans і vq у SciPy.
  • Згенеруйте центри кластерів за допомогою функції kmeans() із двома кластерами.
  • Створіть мітки кластерів, використавши ці центри кластерів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Редагувати та запускати код