Bắt đầu ngayBắt đầu miễn phí

Giảm rủi ro định danh bằng khái quát hóa (generalization)

Trong bài tập này, bạn sẽ áp dụng phép khái quát hóa trên tập dữ liệu IBM HR Analytics Employee Attrition & Performance.

Cụ thể hơn, bạn sẽ biến đổi biến monthly_income thành một cột nhị phân. Ngưỡng dùng cho phép biến đổi sẽ là giá trị trung bình của lương sau khi làm tròn lên. Giá trị mới sẽ là 0 cho các mục nhỏ hơn hoặc bằng giá trị trung bình dạng số nguyên, và 1 cho các mục lớn hơn.

Tập dữ liệu đã được nạp dưới dạng pandas DataFrame hr.

Bài tập này là một phần của khóa học

Bảo mật dữ liệu và Ẩn danh trong Python

Xem khóa học

Hướng dẫn bài tập

  • Tính giá trị trung bình của cột monthly_income bằng .mean() và làm tròn về số nguyên. Lưu lại vào mean_income.
  • Áp dụng một hàm lambda lên hr['monthly_income'] để khái quát hóa thu nhập: gán 0 cho các giá trị nhỏ hơn hoặc bằng mean_income, và 1 cho các giá trị lớn hơn.
  • Khám phá 5 dòng đầu tiên của DataFrame hr sau khi xử lý.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Chỉnh sửa và Chạy Mã