Zacznij terazZacznij za darmo

Eksploracja rozkładu danych

Kiedy chcemy zanonimizować zbiór danych poprzez próbkowanie w realistyczny sposób, musimy zdobyć pewną wiedzę dziedzinową i statystyczną na temat tych danych. Jak już wiemy, kluczowe jest znalezienie rozkładu prawdopodobieństwa interesującej nas kolumny.

W tym ćwiczeniu przyjrzysz się kolumnie business_travel z uproszczonej wersji zbioru danych IBM HR.

DataFrame został zaimportowany jako hr, a numpy jako np. Jak wspomniano w poprzednim rozdziale, pandas został zaimportowany jako pd – dotyczy to tego i wszystkich kolejnych ćwiczeń w kursie.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the absolute frequencies of each unique value
print(____)
Edytuj i uruchom kod