Kom igångKom igång gratis

Minska identifieringsrisken med generalisering

I den här övningen tillämpar du generalisering på IBM HR Analytics-datamängden för medarbetaravgång och prestanda.

Mer specifikt ska du omvandla variabeln monthly_income till en binär kolumn. Tröskelvärdet för omvandlingen är medelvärdet av lönerna avrundat uppåt. De nya värdena blir 0 för dem som är mindre än eller lika med heltalsmedelvärdet, och 1 för dem som är större.

Datamängden är inläst som en pandas DataFrame hr.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Beräkna medelvärdet för kolumnen monthly_income med .mean() och avrunda det till ett heltal. Spara resultatet som mean_income.
  • Tillämpa en lambda-funktion på hr['monthly_income'] för att generalisera inkomsterna till 0 för värden som är mindre än eller lika med mean_income, och till 1 för dem som är större.
  • Utforska de första fem raderna i den resulterande DataFrame:n hr.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Redigera och kör kod