Phân cụm k-means và so sánh kết quả
Như bạn đã biết, có hai loại phân cụm chính: phân cấp (hierarchical) và k-means.
Trong bài tập này, bạn sẽ tạo một mô hình phân cụm k-means trên dữ liệu ung thư vú Wisconsin và so sánh kết quả với chẩn đoán thực tế cũng như với mô hình phân cụm phân cấp mà bạn đã xây dựng. Hãy dành thời gian quan sát cách mỗi mô hình phân cụm tách hai loại chẩn đoán và cách chúng so sánh với nhau.
Bài tập này là một phần của khóa học
Học không giám sát với R
Hướng dẫn bài tập
wisc.data, diagnosis, và wisc.hclust.clusters vẫn còn sẵn sàng.
- Tạo một mô hình k-means trên
wisc.data, gán kết quả vàowisc.km. Nhớ tạo 2 cụm tương ứng với số lượng chẩn đoán thực tế. Đồng thời, hãy chuẩn hóa dữ liệu và lặp thuật toán 20 lần để tìm mô hình hoạt động tốt. - Dùng hàm
table()để so sánh thành viên cụm của mô hình k-means với chẩn đoán thực tế trong vectordiagnosis. k-means tách hai chẩn đoán tốt đến mức nào? - Dùng hàm
table()để so sánh thành viên cụm của mô hình k-means với mô hình phân cụm phân cấp. Nhớ rằng thành viên cụm của mô hình phân cụm phân cấp nằm trongwisc.hclust.clusters.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering