Začněte nyníZačněte zdarma

Snížení rizika identifikace pomocí generalizace

V tomto cvičení aplikuješ generalizaci na datovou sadu IBM HR Analytics Employee Attrition & Performance.

Konkrétně transformuješ proměnnou monthly_income na binární sloupec. Prahová hodnota pro transformaci bude zaokrouhlený průměr platů. Nové hodnoty budou 0 pro ty, které jsou menší nebo rovny celočíselnému průměru, a 1 pro ty, které jsou větší.

Dataset je načten jako pandas DataFrame hr.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej průměrnou hodnotu sloupce monthly_income pomocí .mean() a zaokrouhli ji na celé číslo. Ulož ji jako mean_income.
  • Aplikuj lambda funkci na hr['monthly_income'], aby se příjmy generalizovaly na 0 pro hodnoty menší nebo rovné mean_income a na 1 pro hodnoty větší.
  • Prozkoumej prvních pět řádků výsledného DataFrame hr.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Upravit a spustit kód