Однорідні шаблони кластеризації
Тепер, коли ви знайомі з впливом початкових точок (seeds), розгляньмо упередженість k-means до формування однорідних кластерів.
У наступній вправі використаємо «мишеподібний» набір даних. Мишеподібний набір даних — це група точок, що нагадує голову миші: три кластери точок, розташовані по колу, окремо для мордочки та двох вушок.
Ось як зазвичай виглядає мишеподібний набір даних (Джерело).
Дані збережено в датафреймі pandas mouse. x_scaled і y_scaled — це назви стовпців зі стандартизованими координатами X та Y точок даних.
Ця вправа є частиною курсу
Кластерний аналіз у Python
Інструкції до вправи
- Імпортуйте функції
kmeansіvqзі SciPy. - Згенеруйте центри кластерів за допомогою функції
kmeans()з трьома кластерами. - Створіть мітки кластерів за допомогою
vq()на основі центрів кластерів, згенерованих вище.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the kmeans and vq functions
____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
mouse['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = mouse)
plt.show()