ПочатиПочніть безкоштовно

Важливість ознак у кластеризації за допомогою ARI

Скористайтеся скоригованим індексом Ренда (Adjusted Rand Index, ARI), щоб кількісно виміряти вплив вилучення кожної ознаки на призначення кластерів у наборі даних клієнтів, з яким ви працювали в попередній вправі, попередньо завантаженому в X.

Функцію adjusted_rand_score() і змінну column_names вже підготовлено для вас.

Ця вправа є частиною курсу

Пояснюваний ШІ в Python

Переглянути курс

Інструкції до вправи

  • Отримайте початкові призначення кластерів у original_clusters.
  • У циклі for вилучайте ознаки по одній і зберігайте результат у X_reduced.
  • Отримайте reduced_clusters, застосувавши K-means до X_reduced.
  • Обчисліть importance ознаки на основі ARI між reduced_clusters та original_clusters.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____

for i in range(X.shape[1]):
  	# Remove feature at index i
    X_reduced = ____
    # Derive reduced clusters
    reduced_clusters = ____
    # Derive feature importance
    importance = ____
    print(f'{column_names[i]}: {importance}')
Редагувати та запускати код