Обчисліть і побудуйте графік суми квадратів похибок
Тепер ви обчислите суму квадратів похибок для різної кількості кластерів від 1 до 10.
Ви використаєте нормалізовані дані RFMT, створені у попередній вправі, — вони збережені як datamart_rfmt_normalized. Модуль KMeans зі scikit-learn також імпортовано. Крім того, ми ініціалізували порожній словник для збереження сум квадратів похибок: sse = {}.
За потреби досліджуйте дані в консолі.
Ця вправа є частиною курсу
Сегментація клієнтів у Python
Інструкції до вправи
- Ініціалізуйте KMeans з
kкластерами та random_state 1 і навчіть KMeans на нормалізованому наборі даних. - Присвойте суму квадратів відстаней елементу з ключем
kу словникуsse. - Додайте заголовок графіка "The Elbow Method", підпис осі X "k" і підпис осі Y "SSE".
- Побудуйте значення SSE для кожного
k, що збережені як ключі у словнику.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Fit KMeans and calculate SSE for each k between 1 and 10
for k in range(1, 11):
# Initialize KMeans with k clusters and fit it
kmeans = ____(____=____, ____=1 ).____(datamart_rfmt_normalized)
# Assign sum of squared distances to k element of the sse dictionary
____[____] = kmeans.____
# Add the plot title, x and y axis labels
plt.____('The Elbow Method')
plt.____('____')
plt.____('____')
# Plot SSE values for each k stored as keys in the dictionary
sns.____(x=list(sse.____()), y=list(sse.____()))
plt.show()