同じ確率分布を持つデータセット
合成データの目的は、できるだけ現実的でありながら、重要な個人情報を危険にさらさないデータセットを作ることです。たとえば、Deloitte Consulting のチームは、データを合成することで Machine Learning モデルの学習データの 80% を生成しました。結果として得られたモデルの精度は、実データで学習したモデルと同程度でした。
この演習では、p として読み込まれた確率分布に従うように、Faker を使ってゼロから合成データセットを生成します。
Faker のジェネレーター fake_data はすでに初期化済みで、numpy は np としてインポートされています。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)