Eksploracja rozkładu danych
Kiedy chcemy zanonimizować zbiór danych poprzez próbkowanie w realistyczny sposób, musimy zdobyć pewną wiedzę dziedzinową i statystyczną na temat tych danych. Jak już wiemy, kluczowe jest znalezienie rozkładu prawdopodobieństwa interesującej nas kolumny.
W tym ćwiczeniu przyjrzysz się kolumnie business_travel z uproszczonej wersji zbioru danych IBM HR.
DataFrame został zaimportowany jako hr, a numpy jako np. Jak wspomniano w poprzednim rozdziale, pandas został zaimportowany jako pd – dotyczy to tego i wszystkich kolejnych ćwiczeń w kursie.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the absolute frequencies of each unique value
print(____)