Bắt đầu ngayBắt đầu miễn phí

Tạo dữ liệu cho phân cụm

Dữ liệu tổng hợp (synthetic) là hợp pháp hoàn toàn và đáp ứng mọi yêu cầu của các luật và quy định về quyền riêng tư trên toàn thế giới. Đây là một lựa chọn hợp lệ, tôn trọng quyền riêng tư thay cho dữ liệu thô. Hàm make_blobs() có thể được dùng để tạo các điểm dữ liệu theo phân phối Gaussian (hay chuẩn).

Trong bài tập này, bạn sẽ tạo một tập dữ liệu gồm 15000 mẫu.

numpy đã được import sẵn với tên np, và hàm tùy chỉnh plot_data_points() cũng đã được cung cấp lại cho bài tập này.

Bài tập này là một phần của khóa học

Bảo mật dữ liệu và Ẩn danh trong Python

Xem khóa học

Hướng dẫn bài tập

  • Import hàm tương ứng từ mô-đun datasets để tạo tập dữ liệu cho phân cụm.
  • Tạo một tập dữ liệu gồm 15000 mẫu với 2 đặc trưng, 2 tâm cụm, và độ lệch chuẩn của cụm là 3.
  • In shape của dữ liệu được tạo.
  • Quan sát các điểm dữ liệu thu được bằng biểu đồ scatter 2 chiều.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Chỉnh sửa và Chạy Mã