この演習では、属性を「識別子」「準識別子」「機微情報」に分類します。K-anonymity のプライバシーモデルを効果的に適用・遵守するための最初のステップです。
通常は、情報がやり取りされる文脈に依存します。各選択肢について、人々の一般的な捉え方を考えてみてください。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
データ抑制、マスキング、合成データ生成、一般化といった匿名化手法を実践する準備をしましょう。この章では、機微情報と非機微情報の個人特定情報(PII)の見分け方、準識別子、そして GDPR の基本を学びます。さらに、これらのベストプラクティスに従わなかった場合に現実世界で起こりうる問題の例も確認します。
列の確率分布に従ってデータセットからサンプリングし、データを匿名化する方法を学びます。続いて、リンク攻撃や再識別攻撃を防ぐために k-anonymity のプライバシーモデルを適用し、カテゴリ変数に対して階層を用いたデータ一般化を行う方法を身につけます。
現在の演習
Apple、Google、Uber などの大手テクノロジー企業が採用する Differential Privacy について学びます。この章では、プライベートなヒストグラムを生成したり、データのプライベート平均を計算したりしてデータを探索します。さらに、企業がデータの有用性を高められるように、Differential Privacy を満たす Machine Learning モデルを作成します。
最終章では、主成分分析(PCA)などの次元削減手法を用いて、多数の列を持つ大規模データセットを匿名化する方法を学びます。次に、Faker を使って現実味があり一貫性のあるデータセットを生成し、scikit-learn を使って正規分布に従う合成データセットを作成します。最後に、これまで学んだ内容を統合し、複数の手法を組み合わせてデータセットを安全に一般公開するまでを行います。