Zmniejszanie ryzyka identyfikacji za pomocą generalizacji
W tym ćwiczeniu zastosujesz generalizację na zbiorze danych IBM HR Analytics Employee Attrition & Performance.
Dokładniej rzecz ujmując, przekształcisz zmienną monthly_income w kolumnę binarną. Progiem używanym do transformacji będzie zaokrąglona w górę średnia wartość wynagrodzeń. Nowe wartości wyniosą 0 dla tych, które są mniejsze lub równe średniej całkowitej, i 1 dla tych, które są od niej większe.
Zbiór danych jest wczytany jako DataFrame hr biblioteki pandas.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Instrukcje do ćwiczenia
- Oblicz średnią wartość kolumny
monthly_incomeza pomocą.mean()i zaokrąglij ją do liczby całkowitej. Zapisz wynik jakomean_income. - Zastosuj funkcję
lambdanahr['monthly_income'], aby uogólnić wynagrodzenia: przypisz wartość 0 dla wartości mniejszych lub równychmean_incomei wartość 1 dla tych, które są większe. - Wyświetl pierwszych pięć wierszy wynikowego DataFrame
hr.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)