Zacznij terazZacznij za darmo

Przygotowanie danych pracowników do bezpiecznego udostępnienia

Pracując z rzeczywistymi danymi, musisz zadbać o to, żeby dane osobowe klientów i innych osób nie mogły zostać odtworzone ani ujawnione. W tym ćwiczeniu skorzystasz z uproszczonej wersji zbioru danych IBM HR Analytics Employee, aby przećwiczyć techniki supresji i generalizacji.

Aby uniknąć ujawnienia informacji o zbiorze danych, zastąpisz nazwy kolumn liczbami.

DataFrame jest wczytany jako hr – użyj konsoli, żeby go zbadać. numpy jest zaimportowany jako np.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Edytuj i uruchom kod