Reducerea riscului de identificare prin generalizare
În acest exercițiu, vei aplica generalizarea pe setul de date IBM HR Analytics Employee Attrition & Performance.
Mai concret, vei transforma variabila monthly_income într-o coloană binară. Pragul folosit pentru transformare va fi media salariilor, rotunjită în sus la număr întreg. Noile valori vor fi 0 pentru salariile mai mici sau egale cu media întreagă și 1 pentru cele mai mari.
Setul de date este încărcat ca DataFrame pandas hr.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Instrucțiuni pentru exercițiu
- Calculează valoarea medie a coloanei
monthly_incomefolosind.mean()și rotunjește-o la un număr întreg. Salvează rezultatul camean_income. - Aplică o funcție
lambdapehr['monthly_income']pentru a generaliza veniturile: 0 pentru valorile mai mici sau egale cumean_incomeși 1 pentru cele mai mari. - Explorează primele cinci rânduri ale DataFrame-ului rezultat
hr.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)