Важность признаков в кластеризации с помощью ARI
Используйте скорректированный индекс Рэнда (ARI), чтобы количественно оценить влияние удаления каждого признака на распределение по кластерам в наборе данных о клиентах, с которым вы работали в предыдущем упражнении. Набор данных предварительно загружен в переменную X.
Функция adjusted_rand_score() и переменная column_names уже загружены для вас.
Это упражнение является частью курса
Объяснимый ИИ на Python
Инструкции к упражнению
- Получите исходные метки кластеров и сохраните их в
original_clusters. - В цикле
forудаляйте признаки по одному и сохраняйте результат вX_reduced. - Вычислите
reduced_clusters, применив метод K-средних кX_reduced. - Рассчитайте
importanceкаждого признака на основе ARI междуreduced_clustersиoriginal_clusters.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')