使用 ARI 评估聚类中的特征重要性
利用调整兰德指数(Adjusted Rand Index,ARI)定量评估在客户数据集中移除每个特征对簇分配的影响。该数据集已在上一个练习中使用,并预加载为 X。
adjusted_rand_score() 函数和变量 column_names 已为您预加载。
本练习是课程的一部分
Python 可解释性 AI
练习说明
- 计算原始簇分配,保存到
original_clusters。 - 在 for 循环中,逐个移除特征,并将结果保存为
X_reduced。 - 对
X_reduced应用 K-means,得到reduced_clusters。 - 基于
reduced_clusters与original_clusters之间的 ARI 计算特征的importance。
交互式实操练习
通过完成这段示例代码来试试这个练习。
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')