在這個練習中,你要將屬性分類為可識別、準識別,以及敏感屬性。這是有效套用並遵循 K-anonymity(k-匿名)隱私模型的第一步。
通常,這會取決於資訊流通的情境。對於每個選項,想想一般人會怎麼看待。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
準備動手套用匿名化技術,例如資料抑制、遮罩、合成資料生成與概化。在本章中,你將學會如何區分敏感與非敏感的可識別個人資訊(PII)、準識別項,以及 GDPR 的基礎。你也會看到真實案例,了解若不遵循這些最佳做法,可能會出現哪些問題。
了解如何透過依欄位機率分佈進行抽樣來匿名化資料。接著你將學會套用 k-匿名性隱私模型,以防範連結或重新識別攻擊,並使用階層來對類別變數執行資料概化。
當前練習
認識差分隱私——Apple、Google、Uber 等大型科技公司採用的模型。本章中,你將透過產生私有直方圖與計算私有平均值來探索資料。你也會建立具差分隱私的機器學習模型,協助企業提升資料的可用性。
在最後一章,你將學會套用降維方法,例如主成分分析(PCA),以匿名化大型多欄資料集。接著你會使用 Faker 產生真實且一致的資料集,並以 scikit-learn 建立服從常態分佈的合成資料集。最後,你會把本課程所學整合起來,結合多種技術,安全地將資料集公開發布。