Zacznij terazZacznij za darmo

Oblicz sumę kwadratów błędów

W tym ćwiczeniu obliczysz sumę kwadratów błędów dla różnych liczb klastrów – od 1 do 15. W tym przykładzie korzystamy z niestandardowego zbioru danych, który pozwala uzyskać wyraźniejszy wykres łokcia.

Znormalizowana wersja danych została wczytana jako data_normalized. Moduł KMeans z biblioteki scikit-learn jest już zaimportowany. Zainicjalizowaliśmy również pusty słownik do przechowywania sumy kwadratów błędów: sse = {}.

Możesz swobodnie eksplorować dane w konsoli.

To ćwiczenie jest częścią kursu

Segmentacja klientów w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Dopasuj KMeans i oblicz SSE dla każdego k z zakresu od 1 do 15.
  • Zainicjalizuj KMeans z k klastrami i stanem losowym 1.
  • Dopasuj KMeans na znormalizowanym zbiorze danych.
  • Przypisz sumę kwadratów odległości do elementu k słownika sse.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Fit KMeans and calculate SSE for each k
for k in range(____, ____):
  
    # Initialize KMeans with k clusters
    kmeans = ____(n_clusters=____, random_state=1)
    
    # Fit KMeans on the normalized dataset
    kmeans.____(data_normalized)
    
    # Assign sum of squared distances to k element of dictionary
    sse[____] = kmeans.____
Edytuj i uruchom kod