K-means-klustring: första övningen
I den här övningen bekantar du dig med hur k-means-klustring används på en datamängd. Vi använder Comic Con-datamängden och undersöker hur k-means-klustring fungerar på den.
Kom ihåg de två stegen i k-means-klustring:
- Definiera klustercentrum med funktionen
kmeans(). Den kräver två argument: observationer och antal kluster. - Tilldela klusteretikett med funktionen
vq(). Den kräver också två argument: observationer och klustercentrum.
Data lagras i en pandas DataFrame, comic_con. x_scaled och y_scaled är kolumnnamnen för de standardiserade X- och Y-koordinaterna för personer vid en given tidpunkt.
Den här övningen är en del av kursen
Klusteranalys i Python
Övningsinstruktioner
- Importera funktionerna
kmeansochvqi SciPy. - Generera klustercentrum med funktionen
kmeans()och två kluster. - Skapa klusteretiketterna med hjälp av dessa klustercentrum.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()