ПочатиПочніть безкоштовно

Однорідні шаблони кластеризації

Тепер, коли ви знайомі з впливом початкових точок (seeds), розгляньмо упередженість k-means до формування однорідних кластерів.

У наступній вправі використаємо «мишеподібний» набір даних. Мишеподібний набір даних — це група точок, що нагадує голову миші: три кластери точок, розташовані по колу, окремо для мордочки та двох вушок.

Ось як зазвичай виглядає мишеподібний набір даних (Джерело).

Дані збережено в датафреймі pandas mouse. x_scaled і y_scaled — це назви стовпців зі стандартизованими координатами X та Y точок даних.

Ця вправа є частиною курсу

Кластерний аналіз у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функції kmeans і vq зі SciPy.
  • Згенеруйте центри кластерів за допомогою функції kmeans() з трьома кластерами.
  • Створіть мітки кластерів за допомогою vq() на основі центрів кластерів, згенерованих вище.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the kmeans and vq functions
____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
mouse['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = mouse)
plt.show()
Редагувати та запускати код