カテゴリデータに階層を使う
この演習では、US Adult Income データセットの bachelors 列にデータの一般化を適用するため、階層を作成して使用します。
階層を含む初期の辞書 hierarchies が用意されています。教育の種類を Primary、Secondary、Higher の3カテゴリに分け、それぞれに対応する教育の値のリストが入っています。インタラクティブコンソールで自由に確認してみてください。
元の値を置き換えるため、一般化した教育情報を保持する新しい辞書を作成します。
データセットは income_df として利用できます。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
演習の手順
education_hierarchyを空の辞書として初期化します。- 内側のループを完成させ、教育タイプの
keyを値として代入します。例:{'Some-college': 'Higher education'}。 - 教育階層の一般化を
bachelors列に適用し、結果を新しい列bachelors_generalizedに代入します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())