Výpočet a vizualizace součtu čtverců chyb
Teď vypočítáš součet čtverců chyb pro různé počty clusterů v rozsahu od 1 do 10.
Použiješ normalizovaná RFMT data vytvořená v předchozím cvičení, která jsou uložena jako datamart_rfmt_normalized. Modul KMeans z balíčku scikit-learn je již naimportován. Také jsme inicializovali prázdný slovník pro ukládání součtu čtverců chyb: sse = {}.
Klidně si data nejdřív prozkoumej v konzoli.
Toto cvičení je součástí kurzu
Segmentace zákazníků v Pythonu
Pokyny k cvičení
- Inicializuj KMeans s
kclustery a náhodným stavem 1 a přizpůsob KMeans na normalizovaný dataset. - Přiřaď součet čtverců vzdáleností k prvku
kve slovníkusse. - Přidej název grafu „The Elbow Method", popisek osy X „k" a popisek osy Y „SSE".
- Vykresli hodnoty SSE pro každé
kuložené jako klíče ve slovníku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit KMeans and calculate SSE for each k between 1 and 10
for k in range(1, 11):
# Initialize KMeans with k clusters and fit it
kmeans = ____(____=____, ____=1 ).____(datamart_rfmt_normalized)
# Assign sum of squared distances to k element of the sse dictionary
____[____] = kmeans.____
# Add the plot title, x and y axis labels
plt.____('The Elbow Method')
plt.____('____')
plt.____('____')
# Plot SSE values for each k stored as keys in the dictionary
sns.____(x=list(sse.____()), y=list(sse.____()))
plt.show()