开始使用免费开始使用

具有相同概率分布的数据集

合成数据的目标是创建一个尽可能逼真的数据集,同时不危及重要的个人信息。例如,Deloitte Consulting 的一个团队通过合成数据生成了机器学习模型 80% 的训练数据。最终模型的准确率与使用真实数据训练的模型相当。

在本练习中,您将使用 Faker 从零开始生成一个遵循已加载为 p 的概率分布的合成数据集。

Faker 生成器 fake_data 已初始化,且已将 numpynp 导入。

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
编辑并运行代码