Začněte nyníZačněte zdarma

Příprava dat o zaměstnancích pro bezpečné zveřejnění

Při práci s reálnými daty je potřeba zajistit, aby osobní informace zákazníků ani jiných osob nebylo možné dohledat ani odhalit. V tomto cvičení použiješ zjednodušenou verzi datasetu IBM HR Analytics Employee a procvičíš techniky potlačení a generalizace dat.

Aby nedošlo k úniku informací o datasetu, nahradíš názvy sloupců čísly.

DataFrame je načten jako hr, prozkoumej ho v konzoli. numpy je importován jako np.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Upravit a spustit kód