Importanța caracteristicilor în clustering cu ARI
Folosește Adjusted Rand Index (ARI) pentru a măsura cantitativ impactul eliminării fiecărei caracteristici asupra atribuirilor de cluster în setul de date despre clienți cu care ai lucrat în exercițiul anterior, pre-încărcat în X.
Funcția adjusted_rand_score() și variabila column_names sunt deja pre-încărcate.
Acest exercițiu face parte din cursul
AI Explicabil în Python
Instrucțiuni pentru exercițiu
- Determină atribuirile originale de cluster în
original_clusters. - În bucla
for, elimină caracteristicile una câte una și salvează rezultatul înX_reduced. - Obține
reduced_clustersaplicând K-means peX_reduced. - Calculează
importancepentru fiecare caracteristică pe baza ARI dintrereduced_clustersșioriginal_clusters.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')