Začněte nyníZačněte zdarma

Vzorkování z nejlepší spojité distribuce

Náhodné vzorkování z pravděpodobnostního rozdělení, které dobře odpovídá datům, pomáhá chránit soukromí a zároveň umožňuje oprávněným stranám provádět přesnou statistickou analýzu.

V tomto cvičení anonymizuješ sloupec monthly_income z datové sady IBM. V předchozí lekci jsi určil/a, že nejlépe sedí spojité rozdělení exponnorm. Použij ho k modelování příjmů.

Dataset je k dispozici jako hr.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj modul stats z balíčku scipy.
  • Napasuj rozdělení exponnorm na spojitou proměnnou monthly_income, aby sis získal/a parametry distribuce potřebné pro generování vzorků.
  • Vyber vzorky z rozdělení exponnorm a nahraď jimi monthly_income pomocí metody .rvs(). Nastav velikost vzorku tak, aby odpovídala délce sloupce.
  • Zaokrouhli mzdy na nejbližší celé číslo.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import stats from scipy
____

# Fit the exponnorm distribution to the continuous variable monthly income
params = ____

# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____

# Round the salaries to their closest integer
hr['monthly_income'] = ____

# See the resulting dataset
print(hr.head())
Upravit a spustit kód