特征对聚类质量的影响
探索单个特征如何影响 KMeans 模型的聚类表现。数据集 X 用于基于 3 个特征进行客户分群:收入、子女数量,以及家中青少年数量。
silhouette_score 函数和变量 column_names 已为您预加载。
本练习是课程的一部分
Python 可解释性 AI
练习说明
- 计算原始轮廓系数(
original_score)。 - 在 for 循环中逐一删除特征,并将结果保存到
X_reduced。 - 计算新的轮廓系数(
new_score)。 - 计算该特征的
impact。
交互式实操练习
通过完成这段示例代码来试试这个练习。
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
kmeans.fit(X_reduced)
# Compute the new silhouette score
new_score = ____
# Compute the feature's impact
impact = ____
print(f'Feature {column_names[i]}: Impact = {impact}')