Impactul caracteristicilor asupra calității clusterizării
Explorează cum influențează caracteristicile individuale performanța de clusterizare a unui model KMeans. Setul de date X este folosit pentru segmentarea clienților pe baza a trei caracteristici: venit, numărul de copii și numărul de adolescenți din gospodărie.
Funcția silhouette_score și variabila column_names au fost preîncărcate pentru tine.
Acest exercițiu face parte din cursul
AI Explicabil în Python
Instrucțiuni pentru exercițiu
- Calculează scorul silhouette inițial (
original_score). - În bucla for, elimină caracteristicile una câte una și salvează rezultatul în
X_reduced. - Calculează noul scor silhouette (
new_score). - Calculează
impact-ul caracteristicii.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
kmeans.fit(X_reduced)
# Compute the new silhouette score
new_score = ____
# Compute the feature's impact
impact = ____
print(f'Feature {column_names[i]}: Impact = {impact}')