ÎncepețiÎncepe gratuit

K-means clustering: primul exercițiu

Acest exercițiu te va familiariza cu utilizarea algoritmului k-means clustering pe un set de date. Vom folosi setul de date Comic Con pentru a vedea cum funcționează k-means clustering pe el.

reamintește-ți cei doi pași ai algoritmului k-means clustering:

  • Definește centrele de cluster prin funcția kmeans(). Aceasta are două argumente obligatorii: observațiile și numărul de clustere.
  • Atribuie etichetele de cluster prin funcția vq(). Aceasta are două argumente obligatorii: observațiile și centrele de cluster.

Datele sunt stocate într-un DataFrame pandas, comic_con. x_scaled și y_scaled sunt numele coloanelor cu coordonatele X și Y standardizate ale persoanelor la un moment dat.

Acest exercițiu face parte din cursul

Analiza clusterelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcțiile kmeans și vq din SciPy.
  • Generează centrele de cluster folosind funcția kmeans() cu două clustere.
  • Creează etichetele de cluster folosind aceste centre de cluster.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Editează și rulează codul