Các tập dữ liệu có cùng phân phối xác suất
Mục tiêu của dữ liệu tổng hợp là tạo ra một tập dữ liệu càng giống thật càng tốt, đồng thời không làm lộ các thông tin cá nhân quan trọng. Ví dụ, một nhóm tại Deloitte Consulting đã tạo ra 80% dữ liệu huấn luyện cho một mô hình machine learning bằng cách tổng hợp dữ liệu. Độ chính xác của mô hình thu được tương đương với mô hình được huấn luyện trên dữ liệu thật.
Trong bài tập này, bạn sẽ tự tạo một tập dữ liệu tổng hợp từ đầu bằng Faker sao cho tuân theo một phân phối xác suất đã được nạp là p.
Bộ tạo Faker là fake_data đã được khởi tạo sẵn và numpy đã được import với tên np.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)