一般化で識別リスクを下げる
この演習では、IBM HR Analytics Employee Attrition & Performance データセットに一般化を適用します。
具体的には、monthly_income を2値の列に変換します。変換に使うしきい値は、給与の平均値を四捨五入して整数にしたものです。新しい値は、その整数の平均以下なら 0、より大きければ 1 とします。
データセットは pandas の DataFrame hr として読み込まれています。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
演習の手順
.mean()を使ってmonthly_income列の平均値を計算し、整数に丸めます。mean_incomeとして保存してください。hr['monthly_income']にlambda関数を適用し、mean_income以下を 0、より大きい値を 1 になるように一般化してください。- 変換後の DataFrame
hrの先頭5行を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)