ÎncepețiÎncepe gratuit

Reducerea riscului de identificare prin generalizare

În acest exercițiu, vei aplica generalizarea pe setul de date IBM HR Analytics Employee Attrition & Performance.

Mai concret, vei transforma variabila monthly_income într-o coloană binară. Pragul folosit pentru transformare va fi media salariilor, rotunjită în sus la număr întreg. Noile valori vor fi 0 pentru salariile mai mici sau egale cu media întreagă și 1 pentru cele mai mari.

Setul de date este încărcat ca DataFrame pandas hr.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează valoarea medie a coloanei monthly_income folosind .mean() și rotunjește-o la un număr întreg. Salvează rezultatul ca mean_income.
  • Aplică o funcție lambda pe hr['monthly_income'] pentru a generaliza veniturile: 0 pentru valorile mai mici sau egale cu mean_income și 1 pentru cele mai mari.
  • Explorează primele cinci rânduri ale DataFrame-ului rezultat hr.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Editează și rulează codul