K-means: pierwsze ćwiczenie
To ćwiczenie pozwoli ci zapoznać się z zastosowaniem algorytmu k-means na zbiorze danych. Wykorzystamy zbiór danych Comic Con i sprawdzimy, jak działa na nim grupowanie metodą k-means.
Przypomnienie dwóch kroków algorytmu k-means:
- Wyznaczanie centroidów klastrów za pomocą funkcji
kmeans(). Przyjmuje ona dwa wymagane argumenty: obserwacje oraz liczbę klastrów. - Przypisywanie etykiet klastrów za pomocą funkcji
vq(). Przyjmuje ona dwa wymagane argumenty: obserwacje oraz centroidy klastrów.
Dane są przechowywane w ramce danych pandas o nazwie comic_con. x_scaled i y_scaled to nazwy kolumn ze znormalizowanymi współrzędnymi X i Y osób w danym momencie.
To ćwiczenie jest częścią kursu
Analiza skupień w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcje
kmeansivqz biblioteki SciPy. - Wyznacz centroidy klastrów za pomocą funkcji
kmeans(), tworząc dwa klastry. - Przypisz etykiety klastrów na podstawie wyznaczonych centroidów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()