Důležitost příznaků v clusteringu pomocí ARI
Využij Adjusted Rand Index (ARI) k tomu, abys kvantitativně změřil/a, jaký vliv má odebrání každého příznaku na přiřazení clusterů v zákaznickém datasetu z předchozího cvičení – ten je pro tebe přednahrán v proměnné X.
Funkce adjusted_rand_score() a proměnná column_names jsou již přednahrány.
Toto cvičení je součástí kurzu
Explainable AI v Pythonu
Pokyny k cvičení
- Ulož původní přiřazení clusterů do proměnné
original_clusters. - Ve smyčce
forodebírej příznaky jeden po druhém a výsledek ukládej doX_reduced. - Odvoď
reduced_clustersaplikací K-means naX_reduced. - Vypočítej
importancekaždého příznaku na základě ARI mezireduced_clustersaoriginal_clusters.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')