Generalizace do rozsahů
K-anonymita může být vhodným modelem ochrany soukromí pro datové sady, které nemají příliš mnoho dimenzí. Dvě hlavní anonymizační techniky používané k převodu datové sady na k-anonymní tabulku jsou generalizace a potlačení.
V tomto cvičení převedeš datovou sadu hodnocení spokojenosti na 3-anonymní tabulku obsahující potenciálně citlivé atributy jako satisfaction_rate a work_hours. Některé kombinace se vyskytují méně než třikrát. Oprav to tak, aby byl DataFrame 3-anonymní.
DataFrame je dostupný jako employees. K dispozici je také hodnota k rovná 3.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate how many unique combinations are for BirthYear and Department
print(employees.groupby(['birth_year','department']).____)