Začněte nyníZačněte zdarma

Prozkoumej rozložení dat

Pokud chceme anonymizovat dataset tak, že z něj vzorkujeme data co nejrealističtějším způsobem, potřebujeme mít určité odborné a statistické znalosti o daných datech. Jak jsme viděli, klíčové je najít pravděpodobnostní rozdělení sledovaného sloupce.

V tomto cvičení prozkoumáš sloupec business_travel ze zjednodušené verze IBM HR datasetu.

DataFrame byl naimportován jako hr a numpy jako np. Jak bylo řečeno v předchozí kapitole, pandas byl naimportován jako pd pro toto i všechna další cvičení v kurzu.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the absolute frequencies of each unique value
print(____)
Upravit a spustit kód