Zacznij terazZacznij za darmo

Próbkowanie z najlepiej dopasowanego rozkładu ciągłego

Losowe próbkowanie z dobrze dopasowanego rozkładu prawdopodobieństwa pomaga chronić prywatność, a jednocześnie umożliwia uprawnionym stronom przeprowadzenie dokładnej analizy statystycznej danych.

W tym ćwiczeniu zanonimizujesz kolumnę monthly_income ze zbioru danych IBM. W poprzedniej lekcji ustalono, że rozkład ciągły exponnorm jest najlepiej dopasowany. Użyj go do modelowania dochodów.

Zbiór danych jest dostępny jako hr.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj moduł stats z pakietu scipy.
  • Dopasuj rozkład exponnorm do zmiennej ciągłej monthly_income, aby uzyskać parametry rozkładu i wygenerować próbki.
  • Przeprowadź próbkowanie z rozkładu exponnorm i zastąp wartości monthly_income przy użyciu metody .rvs(). Ustaw rozmiar równy długości tej kolumny.
  • Zaokrąglij wynagrodzenia do najbliższej liczby całkowitej.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import stats from scipy
____

# Fit the exponnorm distribution to the continuous variable monthly income
params = ____

# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____

# Round the salaries to their closest integer
hr['monthly_income'] = ____

# See the resulting dataset
print(hr.head())
Edytuj i uruchom kod