區間化一般化處理
K-anonymity(k-匿名)對維度不多的特定資料集是很不錯的隱私模型。將資料集轉換成 k-匿名表的兩大匿名化技巧是一般化(generalization)與抑制(suppression)。
在這個練習中,你要把一個滿意度評分的資料集轉成 3-匿名的表格,其中包含像是 satisfaction_rate 與 work_hours 這類可能敏感的屬性。有些組合出現次數少於 3。請修正它,讓 DataFrame 達到 3-匿名。
employees DataFrame 已可使用,k 的值為 3。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Calculate how many unique combinations are for BirthYear and Department
print(employees.groupby(['birth_year','department']).____)