Anonymizace datasetu pomocí k-anonymity
V tomto cvičení anonymizuješ dataset NBA Salaries. Nezapomeň, že k aplikaci k-anonymity musíš určit typy atributů – ty mohou být identifikující, kvazi-identifikující, citlivé nebo necitlivé. Zaměříme se na age a nba_origin jako kvazi-identifikující atributy a na salary jako citlivý atribut.
Prozkoumat nba. Pokud znáš informace o konkrétním hráči – například že pochází ze Španělska a je mu 23 let – snadno se dostaneš k citlivým údajům, jako je jeho plat. Použijeme hodnotu K = 3, která zajistí, že zvolené atributy nelze odlišit od alespoň k-1 dalších řádků.
Slovník hierarchií pro nba_Origin je již připravený jako origin_hierarchy.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print how many unique combinations are for age and nba_origin
print(____)