Bắt đầu ngayBắt đầu miễn phí

Phân cụm k-means: bài tập đầu tiên

Bài tập này giúp bạn làm quen với cách dùng phân cụm k-means trên một tập dữ liệu. Hãy dùng bộ dữ liệu Comic Con và xem k-means hoạt động như thế nào trên đó.

Nhắc lại hai bước của phân cụm k-means:

  • Xác định tâm cụm bằng hàm kmeans(). Hàm này có hai đối số bắt buộc: dữ liệu quan sát và số cụm.
  • Gán nhãn cụm bằng hàm vq(). Hàm này có hai đối số bắt buộc: dữ liệu quan sát và các tâm cụm.

Dữ liệu được lưu trong pandas DataFrame, comic_con. x_scaledy_scaled là tên các cột tọa độ X và Y đã được chuẩn hóa của mọi người tại một thời điểm nhất định.

Bài tập này là một phần của khóa học

Phân cụm trong Python

Xem khóa học

Hướng dẫn bài tập

  • Import các hàm kmeansvq trong SciPy.
  • Tạo các tâm cụm bằng hàm kmeans() với hai cụm.
  • Tạo nhãn cụm dựa trên các tâm cụm này.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Chỉnh sửa và Chạy Mã