Utforska datats fördelning
När vi vill anonymisera en datamängd genom att sampla data på ett realistiskt sätt behöver vi ha viss domän- och statistikkunskap om datan. Som vi har sett är det avgörande att hitta sannolikhetsfördelningen för den kolumn vi är intresserade av.
I den här övningen utforskar du kolumnen business_travel från en förenklad version av IBM HR-datamängden.
DataFrame:en har importerats som hr och numpy som np. Som nämndes i föregående kapitel har pandas importerats som pd för den här och resten av kursen.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the absolute frequencies of each unique value
print(____)