Anonimizacja zbioru danych metodą k-anonimowości
W tym ćwiczeniu zanonimizujesz zbiór danych NBA Salaries. Pamiętaj, że aby zastosować k-anonimowość, musisz określić typy atrybutów. Mogą to być atrybuty identyfikujące, quasi-identyfikujące, wrażliwe lub niewrażliwe. Skupimy się na age i nba_origin jako quasi-identyfikatorach oraz na salary jako danych wrażliwych.
Przeanalizuj zbiór nba. Jeśli znasz informacje o zawodniku – na przykład, że pochodzi z Hiszpanii i ma 23 lata – możesz poznać wrażliwe dane, takie jak jego zarobki! Zastosujemy wartość K równą 3, co gwarantuje, że wybrane atrybuty nie będą rozróżnialne od co najmniej k-1 innych wierszy.
Słownik hierarchii dla nba_Origin jest już utworzony jako origin_hierarchy.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print how many unique combinations are for age and nba_origin
print(____)