or
本練習屬於課程
準備動手套用匿名化技術,例如資料抑制、遮罩、合成資料生成與概化。在本章中,你將學會如何區分敏感與非敏感的可識別個人資訊(PII)、準識別項,以及 GDPR 的基礎。你也會看到真實案例,了解若不遵循這些最佳做法,可能會出現哪些問題。
了解如何透過依欄位機率分佈進行抽樣來匿名化資料。接著你將學會套用 k-匿名性隱私模型,以防範連結或重新識別攻擊,並使用階層來對類別變數執行資料概化。
認識差分隱私——Apple、Google、Uber 等大型科技公司採用的模型。本章中,你將透過產生私有直方圖與計算私有平均值來探索資料。你也會建立具差分隱私的機器學習模型,協助企業提升資料的可用性。
在最後一章,你將學會套用降維方法,例如主成分分析(PCA),以匿名化大型多欄資料集。接著你會使用 Faker 產生真實且一致的資料集,並以 scikit-learn 建立服從常態分佈的合成資料集。最後,你會把本課程所學整合起來,結合多種技術,安全地將資料集公開發布。
當前練習