Vzorkování ze stejného pravděpodobnostního rozložení
Mnoho organizací, například americký Úřad pro sčítání lidu (U.S. Census), zveřejňuje vzorky dat shromážděných o soukromých osobách. Tato data jsou nejprve anonymizována různými technikami a poté se uvolní malá část – obvykle 1 % až 5 % vzorku – aby bylo možné provádět výpočty. Vzorkování je osvědčená metoda, která zachovává statistické vlastnosti dat a umožňuje studovat a pochopit sledovanou populaci.
V tomto cvičení anonymizuješ sloupec department z datasetu IBM HR tak, že budeš vzorkovat z rozložení původního datasetu.
Dataset byl načten jako hr.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Pokyny k cvičení
- Získej relativní frekvence každé jedinečné hodnoty ve sloupci
department. - Extrahuj pravděpodobnosti z proměnné
countsa ulož je do proměnnédistributions. - Proveď vzorkování z dříve vypočítaných pravděpodobnostních rozložení. Velikost vzorku by měla odpovídat velikosti datasetu
hr.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())