Eșantionare din aceeași distribuție de probabilitate
Multe organizații, precum U.S. Census, publică eșantioane din datele colectate despre cetățeni. Aceste seturi de date sunt mai întâi anonimizate prin diverse tehnici, iar apoi un procent mic – între 1% și 5% – este pus la dispoziția publicului pentru a permite efectuarea de calcule. Eșantionarea este cunoscută pentru că păstrează caracteristicile statistice ale datelor, permițând studiul și înțelegerea populației de bază.
În acest exercițiu, vei anonimiza coloana department din setul de date IBM HR prin eșantionare din distribuțiile setului de date original.
Setul de date a fost încărcat ca hr.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Instrucțiuni pentru exercițiu
- Obține frecvențele relative ale fiecărei valori unice din coloana
department. - Extrage probabilitățile din
countsși stochează-le într-o variabilă numitădistributions. - Eșantionează din distribuțiile de probabilitate calculate anterior. Dimensiunea eșantionului trebuie să fie egală cu dimensiunea setului de date
hr.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())