K-means clustering: první cvičení
V tomto cvičení se seznámíš s použitím k-means clusteringu na datové sadě. Využijeme dataset Comic Con a podíváme se, jak na něm k-means clustering funguje.
Připomeň si dva kroky k-means clusteringu:
- Definuj středy clusterů pomocí funkce
kmeans(). Ta vyžaduje dva povinné argumenty: pozorování a počet clusterů. - Přiřaď clusterové štítky pomocí funkce
vq(). Ta také vyžaduje dva povinné argumenty: pozorování a středy clusterů.
Data jsou uložena v pandas DataFrame comic_con. x_scaled a y_scaled jsou názvy sloupců se standardizovanými souřadnicemi X a Y jednotlivých osob v daném okamžiku.
Toto cvičení je součástí kurzu
Cluster Analysis in Python
Pokyny k cvičení
- Importuj funkce
kmeansavqze SciPy. - Pomocí funkce
kmeans()vygeneruj středy clusterů pro dva clustery. - Na základě těchto středů vytvoř clusterové štítky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()