安全に公開するための従業員データの準備
実データを扱うときは、顧客や第三者の個人情報が特定・露出されないよう、万全の対策が必要です。この演習では、IBM HR Analytics Employee データセットの簡略版を使って、抑制(suppression)と一般化(generalization)の手法を練習します。
データセットに関する情報漏えいを防ぐため、列名を番号に置き換えます。
DataFrame は hr として読み込まれています。コンソールで中身を確認してください。numpy は np としてインポート済みです。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____