Важливість ознак у кластеризації за допомогою ARI
Скористайтеся скоригованим індексом Ренда (Adjusted Rand Index, ARI), щоб кількісно виміряти вплив вилучення кожної ознаки на призначення кластерів у наборі даних клієнтів, з яким ви працювали в попередній вправі, попередньо завантаженому в X.
Функцію adjusted_rand_score() і змінну column_names вже підготовлено для вас.
Ця вправа є частиною курсу
Пояснюваний ШІ в Python
Інструкції до вправи
- Отримайте початкові призначення кластерів у
original_clusters. - У циклі for вилучайте ознаки по одній і зберігайте результат у
X_reduced. - Отримайте
reduced_clusters, застосувавши K-means доX_reduced. - Обчисліть
importanceознаки на основі ARI міжreduced_clustersтаoriginal_clusters.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')