由於維度詛咒,維護隱私會變得低效。維度詛咒指的是在處理高維度資料時會出現的一系列問題。當特徵或維度數量增加時,為了能夠準確地進行概化,你所需的資料量會以指數成長。這在 k-匿名特別明顯:欄位越多,要達到 k-匿名的資料集就越複雜。
在資料集的匿名化與對外發布方面,PCA 是如何發揮作用的?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
準備動手套用匿名化技術,例如資料抑制、遮罩、合成資料生成與概化。在本章中,你將學會如何區分敏感與非敏感的可識別個人資訊(PII)、準識別項,以及 GDPR 的基礎。你也會看到真實案例,了解若不遵循這些最佳做法,可能會出現哪些問題。
了解如何透過依欄位機率分佈進行抽樣來匿名化資料。接著你將學會套用 k-匿名性隱私模型,以防範連結或重新識別攻擊,並使用階層來對類別變數執行資料概化。
認識差分隱私——Apple、Google、Uber 等大型科技公司採用的模型。本章中,你將透過產生私有直方圖與計算私有平均值來探索資料。你也會建立具差分隱私的機器學習模型,協助企業提升資料的可用性。
在最後一章,你將學會套用降維方法,例如主成分分析(PCA),以匿名化大型多欄資料集。接著你會使用 Faker 產生真實且一致的資料集,並以 scikit-learn 建立服從常態分佈的合成資料集。最後,你會把本課程所學整合起來,結合多種技術,安全地將資料集公開發布。
當前練習