Bắt đầu ngayBắt đầu miễn phí

K-anonymizing a dataset

Trong bài tập này, bạn sẽ ẩn danh bộ dữ liệu NBA Salaries. Hãy nhớ rằng bạn cần chỉ định loại thuộc tính để áp dụng k-anonymity. Chúng có thể là nhận dạng, bán nhận dạng (quasi-identifying), nhạy cảm hoặc không nhạy cảm. Chúng ta sẽ tập trung vào agenba_origin làm thuộc tính bán nhận dạng và salary là dữ liệu nhạy cảm.

Khám phá nba. Nếu bạn biết thông tin về một cầu thủ, ví dụ anh/chị ấy đến từ Spain và 23 tuổi, thì bạn có thể suy ra thông tin nhạy cảm như mức lương của anh/chị ấy! Ở đây, chúng ta sẽ dùng giá trị K bằng 3, đảm bảo rằng các thuộc tính đã chọn không thể được phân biệt khỏi ít nhất k-1 dòng khác.

Từ điển phân cấp cho nba_Origin đã được tạo sẵn với tên origin_hierarchy.

Bài tập này là một phần của khóa học

Bảo mật dữ liệu và Ẩn danh trong Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Print how many unique combinations are for age and nba_origin
print(____)
Chỉnh sửa và Chạy Mã