Kom igångKom igång gratis

Utforska datats fördelning

När vi vill anonymisera en datamängd genom att sampla data på ett realistiskt sätt behöver vi ha viss domän- och statistikkunskap om datan. Som vi har sett är det avgörande att hitta sannolikhetsfördelningen för den kolumn vi är intresserade av.

I den här övningen utforskar du kolumnen business_travel från en förenklad version av IBM HR-datamängden.

DataFrame:en har importerats som hr och numpy som np. Som nämndes i föregående kapitel har pandas importerats som pd för den här och resten av kursen.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the absolute frequencies of each unique value
print(____)
Redigera och kör kod