Förbereda medarbetardata för säker publicering
När du arbetar med verklig data måste du se till att det inte finns något sätt att spåra eller exponera kunders eller andra personers personuppgifter. I den här övningen använder du en förenklad version av IBM HR Analytics Employee-datamängden för att öva på tekniker för undertryckning och generalisering.
För att undvika att läcka information om datamängden ersätter du kolumnnamnen med siffror.
DataFrame:en är inläst som hr – använd konsolen för att utforska den. numpy är importerat som np.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____