如果查詢超過你在會計器中設定的隱私預算,會發生什麼事?
在這個練習中,我們會建立一個隱私預算會計器 acc,並對已載入為 reading_scores 的學生表現資料集計算閱讀分數的私有平均值。這個操作將會超出隱私預算。
acc
reading_scores
BudgetAccountant 類別已經載入。
BudgetAccountant
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Budget accountant with epsilon of 0.1 acc = ____
準備動手套用匿名化技術,例如資料抑制、遮罩、合成資料生成與概化。在本章中,你將學會如何區分敏感與非敏感的可識別個人資訊(PII)、準識別項,以及 GDPR 的基礎。你也會看到真實案例,了解若不遵循這些最佳做法,可能會出現哪些問題。
了解如何透過依欄位機率分佈進行抽樣來匿名化資料。接著你將學會套用 k-匿名性隱私模型,以防範連結或重新識別攻擊,並使用階層來對類別變數執行資料概化。
認識差分隱私——Apple、Google、Uber 等大型科技公司採用的模型。本章中,你將透過產生私有直方圖與計算私有平均值來探索資料。你也會建立具差分隱私的機器學習模型,協助企業提升資料的可用性。
當前練習
在最後一章,你將學會套用降維方法,例如主成分分析(PCA),以匿名化大型多欄資料集。接著你會使用 Faker 產生真實且一致的資料集,並以 scikit-learn 建立服從常態分佈的合成資料集。最後,你會把本課程所學整合起來,結合多種技術,安全地將資料集公開發布。