Tầm quan trọng của đặc trưng trong phân cụm với ARI
Tận dụng Adjusted Rand Index (ARI) để định lượng tác động của việc loại bỏ từng đặc trưng lên gán nhãn cụm trong bộ dữ liệu khách hàng mà bạn đã làm ở bài trước, đã được nạp sẵn trong X.
Hàm adjusted_rand_score() và biến column_names đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Explainable AI trong Python
Hướng dẫn bài tập
- Suy ra gán nhãn cụm gốc trong
original_clusters. - Trong vòng lặp for, loại bỏ từng đặc trưng và lưu kết quả vào
X_reduced. - Suy ra
reduced_clustersbằng cách áp dụng K-means lênX_reduced. - Tính
importancecủa đặc trưng dựa trên ARI giữareduced_clustersvàoriginal_clusters.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')