Särdragets inverkan på klusterkvalitet
Utforska hur enskilda särdrag påverkar klustringsresultatet för en KMeans-modell. Datamängden X används för kundsegmentering baserat på tre särdrag: inkomst, antal barn och antal tonåringar i hushållet.
Funktionen silhouette_score och variabeln column_names har förinslästs åt dig.
Den här övningen är en del av kursen
Förklarbar AI i Python
Övningsinstruktioner
- Beräkna det ursprungliga silhouette-poängtalet (
original_score). - I for-slingan tar du bort ett särdrag i taget och sparar resultatet i
X_reduced. - Beräkna det nya silhouette-poängtalet (
new_score). - Beräkna särdragets
impact.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
kmeans.fit(X_reduced)
# Compute the new silhouette score
new_score = ____
# Compute the feature's impact
impact = ____
print(f'Feature {column_names[i]}: Impact = {impact}')