具有相同概率分布的数据集
合成数据的目标是创建一个尽可能逼真的数据集,同时不危及重要的个人信息。例如,Deloitte Consulting 的一个团队通过合成数据生成了机器学习模型 80% 的训练数据。最终模型的准确率与使用真实数据训练的模型相当。
在本练习中,您将使用 Faker 从零开始生成一个遵循已加载为 p 的概率分布的合成数据集。
Faker 生成器 fake_data 已初始化,且已将 numpy 以 np 导入。
本练习是课程的一部分
Python 中的数据隐私与匿名化
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)