НачатьНачать бесплатно

Важность признаков в кластеризации с помощью ARI

Используйте скорректированный индекс Рэнда (ARI), чтобы количественно оценить влияние удаления каждого признака на распределение по кластерам в наборе данных о клиентах, с которым вы работали в предыдущем упражнении. Набор данных предварительно загружен в переменную X.

Функция adjusted_rand_score() и переменная column_names уже загружены для вас.

Это упражнение является частью курса

Объяснимый ИИ на Python

Посмотреть курс

Инструкции к упражнению

  • Получите исходные метки кластеров и сохраните их в original_clusters.
  • В цикле for удаляйте признаки по одному и сохраняйте результат в X_reduced.
  • Вычислите reduced_clusters, применив метод K-средних к X_reduced.
  • Рассчитайте importance каждого признака на основе ARI между reduced_clusters и original_clusters.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____

for i in range(X.shape[1]):
  	# Remove feature at index i
    X_reduced = ____
    # Derive reduced clusters
    reduced_clusters = ____
    # Derive feature importance
    importance = ____
    print(f'{column_names[i]}: {importance}')
Редактировать и запускать код