對資料集做 K-匿名化
在這個練習中,你會匿名化 NBA 薪資資料集。記住,套用 k-匿名需要先指定屬性的型別:可辨識(identifying)、準識別(quasi-identifying)、敏感(sensitive)或非敏感(insensitive)。我們會把 age 與 nba_origin 設為準識別欄位,salary 設為敏感資料。
先探索 nba。如果你知道某位球員的資訊,例如他/她來自西班牙而且 23 歲,那你就可能知道像薪資這類的敏感資訊!這裡我們使用 K 值為 3,確保所選屬性至少與其他 k-1 列無法區分。
nba_Origin 的階層字典已建立為 origin_hierarchy。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Print how many unique combinations are for age and nba_origin
print(____)