НачатьНачать бесплатно

Влияние признаков на качество кластеризации

Исследуйте, как отдельные признаки влияют на качество кластеризации модели KMeans. Набор данных X используется для сегментации клиентов на основе трёх признаков: доход, количество детей и количество подростков в домохозяйстве.

Функция silhouette_score и переменная column_names уже загружены для вас.

Это упражнение является частью курса

Объяснимый ИИ на Python

Посмотреть курс

Инструкции к упражнению

  • Вычислите исходный коэффициент силуэта (original_score).
  • В цикле for удаляйте признаки по одному и сохраняйте результат в X_reduced.
  • Вычислите новый коэффициент силуэта (new_score).
  • Вычислите impact — влияние каждого признака.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____

for i in range(X.shape[1]):
  	# Remove feature at index i
    X_reduced = ____
    kmeans.fit(X_reduced)
    # Compute the new silhouette score
    new_score = ____
    # Compute the feature's impact
    impact = ____
    print(f'Feature {column_names[i]}: Impact = {impact}')
Редактировать и запускать код