Phân cụm phân cấp kết tụ (Hierarchical agglomerative clustering)
Ở bài trước, bạn đã thấy cách số lượng cụm trong khi thực hiện K-means có thể ảnh hưởng đến kết quả, giúp bạn tự tin thảo luận về K-means trong phỏng vấn Machine Learning. Tuy nhiên, còn một mô hình phân cụm khác là phân cụm phân cấp kết tụ (hierarchical agglomerative clustering). Trong Python, bạn có thể xác định số cụm tối ưu cho kỹ thuật này cả trực quan lẫn toán học. Bạn sẽ dùng các mô-đun scipy và sklearn cho cả hai cách.
Hãy nhớ rằng việc chọn số cụm tối ưu từ dendrogram phụ thuộc vào cả tiêu chí liên kết (linkage) và ngưỡng khoảng cách. Ở đây, bạn sẽ tạo một dendrogram với ma trận X từ diabetes, rồi vẽ một đường tưởng tượng tại độ dài 1.50 và đếm số đường thẳng đứng bị cắt qua để biểu diễn số cụm tối ưu cho thuật toán phân cụm phân cấp của bạn về sau.
Bài tập này là một phần của khóa học
Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import hierarchical clustering libraries
import ____.____.____ as sch
from ____.____ import ____