始める無料で始める

カテゴリデータに階層を使う

この演習では、US Adult Income データセットの bachelors 列にデータの一般化を適用するため、階層を作成して使用します。

階層を含む初期の辞書 hierarchies が用意されています。教育の種類を PrimarySecondaryHigher の3カテゴリに分け、それぞれに対応する教育の値のリストが入っています。インタラクティブコンソールで自由に確認してみてください。

元の値を置き換えるため、一般化した教育情報を保持する新しい辞書を作成します。

データセットは income_df として利用できます。

この演習はコースの一部です

Pythonで学ぶデータプライバシーと匿名化

コースを見る

演習の手順

  • education_hierarchy を空の辞書として初期化します。
  • 内側のループを完成させ、教育タイプの key を値として代入します。例: {'Some-college': 'Higher education'}
  • 教育階層の一般化を bachelors 列に適用し、結果を新しい列 bachelors_generalized に代入します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
コードを編集して実行