一貫性のある合成データセット
企業が合成データを使う代表的な場面のひとつが、人工知能やMachine Learningモデルの学習です。実世界のデータは収集にコストがかかったり、そもそも入手が難しいことがあります。学習用データに強いクラス不均衡(例:90%以上が同一クラス)がある場合、合成データの生成は精度の高いMachine Learningモデルの構築に役立ちます。
この演習では、Faker を使ってモバイルアプリの評価データセットを生成します。
初期のDataFrameは ratings として読み込まれており、rating と gender の2列があります。Faker() のジェネレーターは fake_data としてすでに初期化されています。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]