使用 ARI 評估叢集中的特徵重要性
運用 Adjusted Rand Index(ARI),量化評估在你於前一個練習中使用的顧客資料集中,移除每個特徵對叢集分配造成的影響;資料已預先載入於 X。
adjusted_rand_score() 函式與 column_names 變數已為你預先載入。
本練習屬於課程
Python 的 Explainable AI
練習說明
- 推導原始叢集分配至
original_clusters。 - 在 for 迴圈中,逐一移除特徵,並將結果存為
X_reduced。 - 對
X_reduced套用 K-means,取得reduced_clusters。 - 根據
reduced_clusters與original_clusters之間的 ARI 計算該特徵的importance。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')