Zacznij terazZacznij za darmo

K-means: pierwsze ćwiczenie

To ćwiczenie pozwoli ci zapoznać się z zastosowaniem algorytmu k-means na zbiorze danych. Wykorzystamy zbiór danych Comic Con i sprawdzimy, jak działa na nim grupowanie metodą k-means.

Przypomnienie dwóch kroków algorytmu k-means:

  • Wyznaczanie centroidów klastrów za pomocą funkcji kmeans(). Przyjmuje ona dwa wymagane argumenty: obserwacje oraz liczbę klastrów.
  • Przypisywanie etykiet klastrów za pomocą funkcji vq(). Przyjmuje ona dwa wymagane argumenty: obserwacje oraz centroidy klastrów.

Dane są przechowywane w ramce danych pandas o nazwie comic_con. x_scaled i y_scaled to nazwy kolumn ze znormalizowanymi współrzędnymi X i Y osób w danym momencie.

To ćwiczenie jest częścią kursu

Analiza skupień w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcje kmeans i vq z biblioteki SciPy.
  • Wyznacz centroidy klastrów za pomocą funkcji kmeans(), tworząc dwa klastry.
  • Przypisz etykiety klastrów na podstawie wyznaczonych centroidów.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Edytuj i uruchom kod