Prozkoumej rozložení dat
Pokud chceme anonymizovat dataset tak, že z něj vzorkujeme data co nejrealističtějším způsobem, potřebujeme mít určité odborné a statistické znalosti o daných datech. Jak jsme viděli, klíčové je najít pravděpodobnostní rozdělení sledovaného sloupce.
V tomto cvičení prozkoumáš sloupec business_travel ze zjednodušené verze IBM HR datasetu.
DataFrame byl naimportován jako hr a numpy jako np. Jak bylo řečeno v předchozí kapitole, pandas byl naimportován jako pd pro toto i všechna další cvičení v kurzu.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the absolute frequencies of each unique value
print(____)