Vzorkování z nejlepší spojité distribuce
Náhodné vzorkování z pravděpodobnostního rozdělení, které dobře odpovídá datům, pomáhá chránit soukromí a zároveň umožňuje oprávněným stranám provádět přesnou statistickou analýzu.
V tomto cvičení anonymizuješ sloupec monthly_income z datové sady IBM. V předchozí lekci jsi určil/a, že nejlépe sedí spojité rozdělení exponnorm. Použij ho k modelování příjmů.
Dataset je k dispozici jako hr.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Pokyny k cvičení
- Importuj modul
statsz balíčkuscipy. - Napasuj rozdělení
exponnormna spojitou proměnnoumonthly_income, aby sis získal/a parametry distribuce potřebné pro generování vzorků. - Vyber vzorky z rozdělení
exponnorma nahraď jimimonthly_incomepomocí metody.rvs(). Nastav velikost vzorku tak, aby odpovídala délce sloupce. - Zaokrouhli mzdy na nejbližší celé číslo.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import stats from scipy
____
# Fit the exponnorm distribution to the continuous variable monthly income
params = ____
# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____
# Round the salaries to their closest integer
hr['monthly_income'] = ____
# See the resulting dataset
print(hr.head())