Oblicz sumę kwadratów błędów
W tym ćwiczeniu obliczysz sumę kwadratów błędów dla różnych liczb klastrów – od 1 do 15. W tym przykładzie korzystamy z niestandardowego zbioru danych, który pozwala uzyskać wyraźniejszy wykres łokcia.
Znormalizowana wersja danych została wczytana jako data_normalized. Moduł KMeans z biblioteki scikit-learn jest już zaimportowany. Zainicjalizowaliśmy również pusty słownik do przechowywania sumy kwadratów błędów: sse = {}.
Możesz swobodnie eksplorować dane w konsoli.
To ćwiczenie jest częścią kursu
Segmentacja klientów w Pythonie
Instrukcje do ćwiczenia
- Dopasuj KMeans i oblicz SSE dla każdego
kz zakresu od 1 do 15. - Zainicjalizuj KMeans z
kklastrami i stanem losowym 1. - Dopasuj KMeans na znormalizowanym zbiorze danych.
- Przypisz sumę kwadratów odległości do elementu
ksłownikasse.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Fit KMeans and calculate SSE for each k
for k in range(____, ____):
# Initialize KMeans with k clusters
kmeans = ____(n_clusters=____, random_state=1)
# Fit KMeans on the normalized dataset
kmeans.____(data_normalized)
# Assign sum of squared distances to k element of dictionary
sse[____] = kmeans.____