Tạo dữ liệu cho phân cụm
Dữ liệu tổng hợp (synthetic) là hợp pháp hoàn toàn và đáp ứng mọi yêu cầu của các luật và quy định về quyền riêng tư trên toàn thế giới. Đây là một lựa chọn hợp lệ, tôn trọng quyền riêng tư thay cho dữ liệu thô. Hàm make_blobs() có thể được dùng để tạo các điểm dữ liệu theo phân phối Gaussian (hay chuẩn).
Trong bài tập này, bạn sẽ tạo một tập dữ liệu gồm 15000 mẫu.
numpy đã được import sẵn với tên np, và hàm tùy chỉnh plot_data_points() cũng đã được cung cấp lại cho bài tập này.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Hướng dẫn bài tập
- Import hàm tương ứng từ mô-đun
datasetsđể tạo tập dữ liệu cho phân cụm. - Tạo một tập dữ liệu gồm
15000mẫu với2đặc trưng,2tâm cụm, và độ lệch chuẩn của cụm là3. - In shape của dữ liệu được tạo.
- Quan sát các điểm dữ liệu thu được bằng biểu đồ scatter 2 chiều.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)