Zacznij terazZacznij za darmo

Maskowanie wrażliwych danych osobowych

Masz do dyspozycji zbiór danych zawierający numery ubezpieczenia społecznego (SSN) obywateli amerykańskich wraz z ich miastami zamieszkania i wiekiem. Gdyby były to dane niepubliczne, udostępnione nam wyłącznie na określonych warunkach, ich ujawnienie oznaczałoby naruszenie prywatności – ujawniasz bowiem informacje, których osoby te nie spodziewały się zobaczyć w obiegu.

Twoim zadaniem jest zanonimizowanie danych poprzez zastosowanie częściowego maskowania wrażliwych danych osobowych w kolumnie ssn. Pamiętaj: maskowanie danych polega na ukrywaniu lub zaciemnianiu informacji w celu zapobiegania naruszeniom prywatności, przy jednoczesnym zachowaniu ogólnego formatu i znaczenia danych.

Zbiór danych został wczytany jako insurance_df. Wynik zapisz w zmiennej masked_df, aby zachować oryginalny insurance_df bez zmian.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Uniformly mask the SSN numbers with *
____

# See resulting DataFrame
print(____)
Edytuj i uruchom kod