Phân cụm k-means: bài tập đầu tiên
Bài tập này giúp bạn làm quen với cách dùng phân cụm k-means trên một tập dữ liệu. Hãy dùng bộ dữ liệu Comic Con và xem k-means hoạt động như thế nào trên đó.
Nhắc lại hai bước của phân cụm k-means:
- Xác định tâm cụm bằng hàm
kmeans(). Hàm này có hai đối số bắt buộc: dữ liệu quan sát và số cụm. - Gán nhãn cụm bằng hàm
vq(). Hàm này có hai đối số bắt buộc: dữ liệu quan sát và các tâm cụm.
Dữ liệu được lưu trong pandas DataFrame, comic_con. x_scaled và y_scaled là tên các cột tọa độ X và Y đã được chuẩn hóa của mọi người tại một thời điểm nhất định.
Bài tập này là một phần của khóa học
Phân cụm trong Python
Hướng dẫn bài tập
- Import các hàm
kmeansvàvqtrong SciPy. - Tạo các tâm cụm bằng hàm
kmeans()với hai cụm. - Tạo nhãn cụm dựa trên các tâm cụm này.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()