具有相同機率分佈的資料集
合成資料的目標,是在不危及個人重要資訊的前提下,建立一個盡可能真實的資料集。例如,Deloitte Consulting 的一個團隊透過合成資料產生了機器學習模型 80% 的訓練資料,最終的模型準確率與使用真實資料訓練的模型相近。
在這個練習中,你將使用 Faker 從零開始產生一個合成資料集,並使其遵循已載入為 p 的機率分佈。
Faker 產生器 fake_data 已經初始化,且已將 numpy 以 np 匯入。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)