Влияние признаков на качество кластеризации
Исследуйте, как отдельные признаки влияют на качество кластеризации модели KMeans. Набор данных X используется для сегментации клиентов на основе трёх признаков: доход, количество детей и количество подростков в домохозяйстве.
Функция silhouette_score и переменная column_names уже загружены для вас.
Это упражнение является частью курса
Объяснимый ИИ на Python
Инструкции к упражнению
- Вычислите исходный коэффициент силуэта (
original_score). - В цикле
forудаляйте признаки по одному и сохраняйте результат вX_reduced. - Вычислите новый коэффициент силуэта (
new_score). - Вычислите
impact— влияние каждого признака.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive the original silhouette score
original_score = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
kmeans.fit(X_reduced)
# Compute the new silhouette score
new_score = ____
# Compute the feature's impact
impact = ____
print(f'Feature {column_names[i]}: Impact = {impact}')