始める無料で始める

一貫性のある合成データセット

企業が合成データを使う代表的な場面のひとつが、人工知能やMachine Learningモデルの学習です。実世界のデータは収集にコストがかかったり、そもそも入手が難しいことがあります。学習用データに強いクラス不均衡(例:90%以上が同一クラス)がある場合、合成データの生成は精度の高いMachine Learningモデルの構築に役立ちます。

この演習では、Faker を使ってモバイルアプリの評価データセットを生成します。

初期のDataFrameは ratings として読み込まれており、ratinggender の2列があります。Faker() のジェネレーターは fake_data としてすでに初期化されています。

この演習はコースの一部です

Pythonで学ぶデータプライバシーと匿名化

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
コードを編集して実行