始める無料で始める

安全に公開するための従業員データの準備

実データを扱うときは、顧客や第三者の個人情報が特定・露出されないよう、万全の対策が必要です。この演習では、IBM HR Analytics Employee データセットの簡略版を使って、抑制(suppression)と一般化(generalization)の手法を練習します。

データセットに関する情報漏えいを防ぐため、列名を番号に置き換えます。

DataFrame は hr として読み込まれています。コンソールで中身を確認してください。numpynp としてインポート済みです。

この演習はコースの一部です

Pythonで学ぶデータプライバシーと匿名化

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
コードを編集して実行