在這個練習中,你會從已載入為 DataFrame clients_df 的資料集中,辨識出一個敏感的 PII 變數。
clients_df
接著,你會對這個 SPII 變數套用屬性抑制。記住,這是最強的匿名化方式,因為無法從該屬性回復出任何資訊。
在本練習及本課程其餘部分,pandas 會替你匯入並以 pd 作為別名。
pandas
pd
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
準備動手套用匿名化技術,例如資料抑制、遮罩、合成資料生成與概化。在本章中,你將學會如何區分敏感與非敏感的可識別個人資訊(PII)、準識別項,以及 GDPR 的基礎。你也會看到真實案例,了解若不遵循這些最佳做法,可能會出現哪些問題。
當前練習
了解如何透過依欄位機率分佈進行抽樣來匿名化資料。接著你將學會套用 k-匿名性隱私模型,以防範連結或重新識別攻擊,並使用階層來對類別變數執行資料概化。
認識差分隱私——Apple、Google、Uber 等大型科技公司採用的模型。本章中,你將透過產生私有直方圖與計算私有平均值來探索資料。你也會建立具差分隱私的機器學習模型,協助企業提升資料的可用性。
在最後一章,你將學會套用降維方法,例如主成分分析(PCA),以匿名化大型多欄資料集。接著你會使用 Faker 產生真實且一致的資料集,並以 scikit-learn 建立服從常態分佈的合成資料集。最後,你會把本課程所學整合起來,結合多種技術,安全地將資料集公開發布。