Kom igångKom igång gratis

K-means-klustring: första övningen

I den här övningen bekantar du dig med hur k-means-klustring används på en datamängd. Vi använder Comic Con-datamängden och undersöker hur k-means-klustring fungerar på den.

Kom ihåg de två stegen i k-means-klustring:

  • Definiera klustercentrum med funktionen kmeans(). Den kräver två argument: observationer och antal kluster.
  • Tilldela klusteretikett med funktionen vq(). Den kräver också två argument: observationer och klustercentrum.

Data lagras i en pandas DataFrame, comic_con. x_scaled och y_scaled är kolumnnamnen för de standardiserade X- och Y-koordinaterna för personer vid en given tidpunkt.

Den här övningen är en del av kursen

Klusteranalys i Python

Visa kurs

Övningsinstruktioner

  • Importera funktionerna kmeans och vq i SciPy.
  • Generera klustercentrum med funktionen kmeans() och två kluster.
  • Skapa klusteretiketterna med hjälp av dessa klustercentrum.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Redigera och kör kod