ÎncepețiÎncepe gratuit

Eșantionare din aceeași distribuție de probabilitate

Multe organizații, precum U.S. Census, publică eșantioane din datele colectate despre cetățeni. Aceste seturi de date sunt mai întâi anonimizate prin diverse tehnici, iar apoi un procent mic – între 1% și 5% – este pus la dispoziția publicului pentru a permite efectuarea de calcule. Eșantionarea este cunoscută pentru că păstrează caracteristicile statistice ale datelor, permițând studiul și înțelegerea populației de bază.

În acest exercițiu, vei anonimiza coloana department din setul de date IBM HR prin eșantionare din distribuțiile setului de date original.

Setul de date a fost încărcat ca hr.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Obține frecvențele relative ale fiecărei valori unice din coloana department.
  • Extrage probabilitățile din counts și stochează-le într-o variabilă numită distributions.
  • Eșantionează din distribuțiile de probabilitate calculate anterior. Dimensiunea eșantionului trebuie să fie egală cu dimensiunea setului de date hr.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
Editează și rulează codul