Próbkowanie z najlepiej dopasowanego rozkładu ciągłego
Losowe próbkowanie z dobrze dopasowanego rozkładu prawdopodobieństwa pomaga chronić prywatność, a jednocześnie umożliwia uprawnionym stronom przeprowadzenie dokładnej analizy statystycznej danych.
W tym ćwiczeniu zanonimizujesz kolumnę monthly_income ze zbioru danych IBM. W poprzedniej lekcji ustalono, że rozkład ciągły exponnorm jest najlepiej dopasowany. Użyj go do modelowania dochodów.
Zbiór danych jest dostępny jako hr.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj moduł
statsz pakietuscipy. - Dopasuj rozkład
exponnormdo zmiennej ciągłejmonthly_income, aby uzyskać parametry rozkładu i wygenerować próbki. - Przeprowadź próbkowanie z rozkładu
exponnormi zastąp wartościmonthly_incomeprzy użyciu metody.rvs(). Ustaw rozmiar równy długości tej kolumny. - Zaokrąglij wynagrodzenia do najbliższej liczby całkowitej.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import stats from scipy
____
# Fit the exponnorm distribution to the continuous variable monthly income
params = ____
# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____
# Round the salaries to their closest integer
hr['monthly_income'] = ____
# See the resulting dataset
print(hr.head())