Příprava dat o zaměstnancích pro bezpečné zveřejnění
Při práci s reálnými daty je potřeba zajistit, aby osobní informace zákazníků ani jiných osob nebylo možné dohledat ani odhalit. V tomto cvičení použiješ zjednodušenou verzi datasetu IBM HR Analytics Employee a procvičíš techniky potlačení a generalizace dat.
Aby nedošlo k úniku informací o datasetu, nahradíš názvy sloupců čísly.
DataFrame je načten jako hr, prozkoumej ho v konzoli. numpy je importován jako np.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____