Vliv příznaků na kvalitu shlukování
Prozkouej, jak jednotlivé příznaky ovlivňují výkon shlukování modelu KMeans. Dataset X slouží k segmentaci zákazníků na základě tří příznaků: příjmu, počtu dětí a počtu teenagerů v domácnosti.
Funkce silhouette_score a proměnná column_names jsou pro tebe předem načteny.
Toto cvičení je součástí kurzu
Explainable AI v Pythonu
Pokyny k cvičení
- Vypočítej původní silhouette skóre (
original_score). - V cyklu for odstraňuj příznaky jeden po druhém a výsledek ukládej do
X_reduced. - Vypočítej nové silhouette skóre (
new_score). - Vypočítej
impactdaného příznaku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
kmeans.fit(X_reduced)
# Compute the new silhouette score
new_score = ____
# Compute the feature's impact
impact = ____
print(f'Feature {column_names[i]}: Impact = {impact}')