K-means clustering: primul exercițiu
Acest exercițiu te va familiariza cu utilizarea algoritmului k-means clustering pe un set de date. Vom folosi setul de date Comic Con pentru a vedea cum funcționează k-means clustering pe el.
reamintește-ți cei doi pași ai algoritmului k-means clustering:
- Definește centrele de cluster prin funcția
kmeans(). Aceasta are două argumente obligatorii: observațiile și numărul de clustere. - Atribuie etichetele de cluster prin funcția
vq(). Aceasta are două argumente obligatorii: observațiile și centrele de cluster.
Datele sunt stocate într-un DataFrame pandas, comic_con. x_scaled și y_scaled sunt numele coloanelor cu coordonatele X și Y standardizate ale persoanelor la un moment dat.
Acest exercițiu face parte din cursul
Analiza clusterelor în Python
Instrucțiuni pentru exercițiu
- Importă funcțiile
kmeansșivqdin SciPy. - Generează centrele de cluster folosind funcția
kmeans()cu două clustere. - Creează etichetele de cluster folosind aceste centre de cluster.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()