Przygotowanie danych pracowników do bezpiecznego udostępnienia
Pracując z rzeczywistymi danymi, musisz zadbać o to, żeby dane osobowe klientów i innych osób nie mogły zostać odtworzone ani ujawnione. W tym ćwiczeniu skorzystasz z uproszczonej wersji zbioru danych IBM HR Analytics Employee, aby przećwiczyć techniki supresji i generalizacji.
Aby uniknąć ujawnienia informacji o zbiorze danych, zastąpisz nazwy kolumn liczbami.
DataFrame jest wczytany jako hr – użyj konsoli, żeby go zbadać. numpy jest zaimportowany jako np.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____