Giảm rủi ro định danh bằng khái quát hóa (generalization)
Trong bài tập này, bạn sẽ áp dụng phép khái quát hóa trên tập dữ liệu IBM HR Analytics Employee Attrition & Performance.
Cụ thể hơn, bạn sẽ biến đổi biến monthly_income thành một cột nhị phân. Ngưỡng dùng cho phép biến đổi sẽ là giá trị trung bình của lương sau khi làm tròn lên. Giá trị mới sẽ là 0 cho các mục nhỏ hơn hoặc bằng giá trị trung bình dạng số nguyên, và 1 cho các mục lớn hơn.
Tập dữ liệu đã được nạp dưới dạng pandas DataFrame hr.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Hướng dẫn bài tập
- Tính giá trị trung bình của cột
monthly_incomebằng.mean()và làm tròn về số nguyên. Lưu lại vàomean_income. - Áp dụng một hàm
lambdalênhr['monthly_income']để khái quát hóa thu nhập: gán 0 cho các giá trị nhỏ hơn hoặc bằngmean_income, và 1 cho các giá trị lớn hơn. - Khám phá 5 dòng đầu tiên của DataFrame
hrsau khi xử lý.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)