Maskowanie wrażliwych danych osobowych
Masz do dyspozycji zbiór danych zawierający numery ubezpieczenia społecznego (SSN) obywateli amerykańskich wraz z ich miastami zamieszkania i wiekiem. Gdyby były to dane niepubliczne, udostępnione nam wyłącznie na określonych warunkach, ich ujawnienie oznaczałoby naruszenie prywatności – ujawniasz bowiem informacje, których osoby te nie spodziewały się zobaczyć w obiegu.
Twoim zadaniem jest zanonimizowanie danych poprzez zastosowanie częściowego maskowania wrażliwych danych osobowych w kolumnie ssn. Pamiętaj: maskowanie danych polega na ukrywaniu lub zaciemnianiu informacji w celu zapobiegania naruszeniom prywatności, przy jednoczesnym zachowaniu ogólnego formatu i znaczenia danych.
Zbiór danych został wczytany jako insurance_df. Wynik zapisz w zmiennej masked_df, aby zachować oryginalny insurance_df bez zmian.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Uniformly mask the SSN numbers with *
____
# See resulting DataFrame
print(____)