Začněte nyníZačněte zdarma

K-means clustering: první cvičení

V tomto cvičení se seznámíš s použitím k-means clusteringu na datové sadě. Využijeme dataset Comic Con a podíváme se, jak na něm k-means clustering funguje.

Připomeň si dva kroky k-means clusteringu:

  • Definuj středy clusterů pomocí funkce kmeans(). Ta vyžaduje dva povinné argumenty: pozorování a počet clusterů.
  • Přiřaď clusterové štítky pomocí funkce vq(). Ta také vyžaduje dva povinné argumenty: pozorování a středy clusterů.

Data jsou uložena v pandas DataFrame comic_con. x_scaled a y_scaled jsou názvy sloupců se standardizovanými souřadnicemi X a Y jednotlivých osob v daném okamžiku.

Toto cvičení je součástí kurzu

Cluster Analysis in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkce kmeans a vq ze SciPy.
  • Pomocí funkce kmeans() vygeneruj středy clusterů pro dva clustery.
  • Na základě těchto středů vytvoř clusterové štítky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Upravit a spustit kód