Zacznij terazZacznij za darmo

Anonimizacja zbioru danych metodą k-anonimowości

W tym ćwiczeniu zanonimizujesz zbiór danych NBA Salaries. Pamiętaj, że aby zastosować k-anonimowość, musisz określić typy atrybutów. Mogą to być atrybuty identyfikujące, quasi-identyfikujące, wrażliwe lub niewrażliwe. Skupimy się na age i nba_origin jako quasi-identyfikatorach oraz na salary jako danych wrażliwych.

Przeanalizuj zbiór nba. Jeśli znasz informacje o zawodniku – na przykład, że pochodzi z Hiszpanii i ma 23 lata – możesz poznać wrażliwe dane, takie jak jego zarobki! Zastosujemy wartość K równą 3, co gwarantuje, że wybrane atrybuty nie będą rozróżnialne od co najmniej k-1 innych wierszy.

Słownik hierarchii dla nba_Origin jest już utworzony jako origin_hierarchy.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print how many unique combinations are for age and nba_origin
print(____)
Edytuj i uruchom kod