Phân cụm K-means
Trong bối cảnh phỏng vấn Machine Learning, bạn có thể được hỏi cách sử dụng đầu ra từ K-means để đánh giá xem đây có phải là thuật toán tốt nhất hay không.
Trong bài tập này, bạn sẽ thực hành phân cụm K-means. Sử dụng thuộc tính .inertia_ để so sánh các mô hình với số cụm khác nhau, k. Bạn cũng sẽ dùng thông tin này để đánh giá số cụm trong bài tiếp theo.
Hãy nhớ rằng biến mục tiêu trong tập dữ liệu diabetes là progression.
Vị trí hiện tại trong pipeline:

Bài tập này là một phần của khóa học
Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import module
from sklearn.cluster import KMeans
# Create feature matrix
X = diabetes.____("____", axis=1)
# Instantiate
kmeans = KMeans(n_clusters=2, random_state=123)
# Fit
fit = kmeans.____(____)
# Print inertia
print("Sum of squared distances for 2 clusters is", kmeans.inertia_)