計算平方誤差總和
在本練習中,你將計算群數從 1 到 15 不同設定下的平方誤差總和。此處我們使用自訂產生的資料集,以便更清楚地觀察 elbow。
我們已載入正規化後的資料為 data_normalized。scikit-learn 的 KMeans 模組也已匯入。此外,我們已初始化一個空的字典 sse = {} 來儲存平方誤差總和。
你可以在主控台中自由探索這些資料。
本練習屬於課程
Python 的客群分群
練習說明
- 在群數 1 到 15 的範圍內,為每個
k擬合 KMeans 並計算 SSE。 - 以
k個群、random state 設為 1 來初始化 KMeans。 - 在正規化後的資料集上擬合 KMeans。
- 將平方距離總和指定給
sse字典中對應k的元素。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Fit KMeans and calculate SSE for each k
for k in range(____, ____):
# Initialize KMeans with k clusters
kmeans = ____(n_clusters=____, random_state=1)
# Fit KMeans on the normalized dataset
kmeans.____(data_normalized)
# Assign sum of squared distances to k element of dictionary
sse[____] = kmeans.____