Explorează distribuția datelor
Când vrem să anonimizăm un set de date prin eșantionare realistă, trebuie să cunoaștem domeniul și să înțelegem statistic datele. Așa cum am văzut, identificarea distribuției de probabilitate a coloanei de interes este esențială.
În acest exercițiu, vei explora coloana business_travel dintr-o versiune simplificată a setului de date IBM HR.
DataFrame-ul a fost importat ca hr, iar numpy ca np. Așa cum s-a menționat în capitolul anterior, pandas a fost importat ca pd pentru acest exercițiu și pentru restul cursului.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print the absolute frequencies of each unique value
print(____)