Khám phá phân phối của dữ liệu
Khi muốn ẩn danh một tập dữ liệu bằng cách lấy mẫu theo cách rất sát thực tế, bạn cần có một chút hiểu biết về miền dữ liệu và thống kê. Như bạn đã thấy, việc xác định phân phối xác suất của cột quan tâm là then chốt.
Trong bài tập này, bạn sẽ khám phá cột business_travel từ phiên bản đơn giản hóa của bộ dữ liệu IBM HR.
DataFrame đã được nhập dưới tên hr và numpy là np. Như đã nói ở chương trước, pandas đã được nhập là pd cho bài này và phần còn lại của khóa học.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print the absolute frequencies of each unique value
print(____)