始める無料で始める

同じ確率分布を持つデータセット

合成データの目的は、できるだけ現実的でありながら、重要な個人情報を危険にさらさないデータセットを作ることです。たとえば、Deloitte Consulting のチームは、データを合成することで Machine Learning モデルの学習データの 80% を生成しました。結果として得られたモデルの精度は、実データで学習したモデルと同程度でした。

この演習では、p として読み込まれた確率分布に従うように、Faker を使ってゼロから合成データセットを生成します。

Faker のジェネレーター fake_data はすでに初期化済みで、numpynp としてインポートされています。

この演習はコースの一部です

Pythonで学ぶデータプライバシーと匿名化

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
コードを編集して実行