開始使用免費開始

對資料集做 K-匿名化

在這個練習中,你會匿名化 NBA 薪資資料集。記住,套用 k-匿名需要先指定屬性的型別:可辨識(identifying)、準識別(quasi-identifying)、敏感(sensitive)或非敏感(insensitive)。我們會把 agenba_origin 設為準識別欄位,salary 設為敏感資料。

先探索 nba。如果你知道某位球員的資訊,例如他/她來自西班牙而且 23 歲,那你就可能知道像薪資這類的敏感資訊!這裡我們使用 K 值為 3,確保所選屬性至少與其他 k-1 列無法區分。

nba_Origin 的階層字典已建立為 origin_hierarchy

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print how many unique combinations are for age and nba_origin
print(____)
編輯並執行程式碼