一致性的合成数据集
企业使用合成数据的一个典型场景是训练人工智能和机器学习模型。现实世界的数据有时采集成本高,或者难以获取。当训练数据严重不平衡(例如,超过 90% 的样本属于同一类别)时,生成合成数据可以帮助构建更准确的机器学习模型。
在本练习中,您将使用 Faker 生成一个移动应用评分数据集。
初始的 DataFrame 已加载为 ratings,包含两列:rating 和 gender。一个 Faker() 生成器也已为您初始化为 fake_data。
本练习是课程的一部分
Python 中的数据隐私与匿名化
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]