用一般化降低識別風險
在這個練習中,你會對 IBM HR Analytics Employee Attrition & Performance 資料集套用一般化(generalization)。
更具體地說,你會把變數 monthly_income 轉換為二元欄位。轉換的門檻是薪資的平均值經四捨五入後的整數。新值規則為:小於或等於此整數平均值者設為 0,大於者設為 1。
資料集已載入為 pandas 的 DataFrame hr。
本練習屬於課程
Data Privacy and Anonymization in Python
練習說明
- 使用
.mean()計算monthly_income欄位的平均值並將其四捨五入為整數,存成mean_income。 - 對
hr['monthly_income']套用lambda函式,將收入一般化:小於或等於mean_income的設為 0,大於的設為 1。 - 檢視處理後的 DataFrame
hr的前 5 列。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)