Výpočet součtu čtverců chyb
V tomto cvičení vypočítáš součet čtverců chyb (SSE) pro různé počty clusterů v rozsahu od 1 do 15. Pracujeme zde s vlastní vytvořenou datovou sadou, aby byl „loket" na grafu lépe viditelný.
Normalizovaná verze dat je načtena jako data_normalized. Modul KMeans ze scikit-learn je už naimportovaný. Také jsme připravili prázdný slovník pro ukládání součtů čtverců chyb: sse = {}.
Data si klidně prozkoumej v konzoli.
Toto cvičení je součástí kurzu
Segmentace zákazníků v Pythonu
Pokyny k cvičení
- Natrénuj KMeans a vypočítej SSE pro každé
kv rozsahu od 1 do 15. - Inicializuj KMeans s
kclustery a náhodným stavem 1. - Natrénuj KMeans na normalizované datové sadě.
- Přiřaď součet čtverců vzdáleností k prvku
kve slovníkusse.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit KMeans and calculate SSE for each k
for k in range(____, ____):
# Initialize KMeans with k clusters
kmeans = ____(n_clusters=____, random_state=1)
# Fit KMeans on the normalized dataset
kmeans.____(data_normalized)
# Assign sum of squared distances to k element of dictionary
sse[____] = kmeans.____