Minska identifieringsrisken med generalisering
I den här övningen tillämpar du generalisering på IBM HR Analytics-datamängden för medarbetaravgång och prestanda.
Mer specifikt ska du omvandla variabeln monthly_income till en binär kolumn. Tröskelvärdet för omvandlingen är medelvärdet av lönerna avrundat uppåt. De nya värdena blir 0 för dem som är mindre än eller lika med heltalsmedelvärdet, och 1 för dem som är större.
Datamängden är inläst som en pandas DataFrame hr.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Övningsinstruktioner
- Beräkna medelvärdet för kolumnen
monthly_incomemed.mean()och avrunda det till ett heltal. Spara resultatet sommean_income. - Tillämpa en
lambda-funktion påhr['monthly_income']för att generalisera inkomsterna till 0 för värden som är mindre än eller lika medmean_income, och till 1 för dem som är större. - Utforska de första fem raderna i den resulterande DataFrame:n
hr.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)