开始使用免费开始使用

一致性的合成数据集

企业使用合成数据的一个典型场景是训练人工智能和机器学习模型。现实世界的数据有时采集成本高,或者难以获取。当训练数据严重不平衡(例如,超过 90% 的样本属于同一类别)时,生成合成数据可以帮助构建更准确的机器学习模型。

在本练习中,您将使用 Faker 生成一个移动应用评分数据集。

初始的 DataFrame 已加载为 ratings,包含两列:ratinggender。一个 Faker() 生成器也已为您初始化为 fake_data

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
编辑并运行代码