Začněte nyníZačněte zdarma

Vzorkování ze stejného pravděpodobnostního rozložení

Mnoho organizací, například americký Úřad pro sčítání lidu (U.S. Census), zveřejňuje vzorky dat shromážděných o soukromých osobách. Tato data jsou nejprve anonymizována různými technikami a poté se uvolní malá část – obvykle 1 % až 5 % vzorku – aby bylo možné provádět výpočty. Vzorkování je osvědčená metoda, která zachovává statistické vlastnosti dat a umožňuje studovat a pochopit sledovanou populaci.

V tomto cvičení anonymizuješ sloupec department z datasetu IBM HR tak, že budeš vzorkovat z rozložení původního datasetu.

Dataset byl načten jako hr.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Získej relativní frekvence každé jedinečné hodnoty ve sloupci department.
  • Extrahuj pravděpodobnosti z proměnné counts a ulož je do proměnné distributions.
  • Proveď vzorkování z dříve vypočítaných pravděpodobnostních rozložení. Velikost vzorku by měla odpovídat velikosti datasetu hr.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
Upravit a spustit kód