ความสำคัญของฟีเจอร์ในการทำ Clustering ด้วย ARI
นำ Adjusted Rand Index (ARI) มาใช้วัดผลกระทบของการลบฟีเจอร์แต่ละตัวออกต่อการจัดกลุ่ม (cluster assignment) ในชุดข้อมูลลูกค้าที่ใช้ในแบบฝึกหัดก่อนหน้า ซึ่งโหลดไว้ล่วงหน้าในตัวแปร X แล้ว
ฟังก์ชัน adjusted_rand_score() และตัวแปร column_names ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Explainable AI ด้วย Python
คำแนะนำการฝึกหัด
- คำนวณการจัดกลุ่มเดิมและเก็บไว้ใน
original_clusters - ใน for loop ให้ลบฟีเจอร์ออกทีละตัว และบันทึกผลลัพธ์ไว้ใน
X_reduced - คำนวณ
reduced_clustersโดยใช้ K-means กับX_reduced - คำนวณค่า
importanceของฟีเจอร์จากค่า ARI ระหว่างreduced_clustersและoriginal_clusters
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
kmeans = KMeans(n_clusters=5, random_state=10, n_init=10).fit(X)
# Derive original clusters
original_clusters = ____
for i in range(X.shape[1]):
# Remove feature at index i
X_reduced = ____
# Derive reduced clusters
reduced_clusters = ____
# Derive feature importance
importance = ____
print(f'{column_names[i]}: {importance}')