為安全公開準備員工資料
在處理真實資料時,你需要確保無法追溯或曝光我們客戶或任何人的個人資訊。這個練習中,你會使用簡化版的 IBM HR Analytics Employee 資料集,練習抑制(suppression)與泛化(generalization)技巧。
為了避免洩漏資料集的資訊,你將把欄位名稱改成數字。
hr 已載入為 DataFrame,請使用主控台加以探索。numpy 以 np 匯入。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____