Začněte nyníZačněte zdarma

Anonymizace datasetu pomocí k-anonymity

V tomto cvičení anonymizuješ dataset NBA Salaries. Nezapomeň, že k aplikaci k-anonymity musíš určit typy atributů – ty mohou být identifikující, kvazi-identifikující, citlivé nebo necitlivé. Zaměříme se na age a nba_origin jako kvazi-identifikující atributy a na salary jako citlivý atribut.

Prozkoumat nba. Pokud znáš informace o konkrétním hráči – například že pochází ze Španělska a je mu 23 let – snadno se dostaneš k citlivým údajům, jako je jeho plat. Použijeme hodnotu K = 3, která zajistí, že zvolené atributy nelze odlišit od alespoň k-1 dalších řádků.

Slovník hierarchií pro nba_Origin je již připravený jako origin_hierarchy.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print how many unique combinations are for age and nba_origin
print(____)
Upravit a spustit kód