Kom igångKom igång gratis

Förbereda medarbetardata för säker publicering

När du arbetar med verklig data måste du se till att det inte finns något sätt att spåra eller exponera kunders eller andra personers personuppgifter. I den här övningen använder du en förenklad version av IBM HR Analytics Employee-datamängden för att öva på tekniker för undertryckning och generalisering.

För att undvika att läcka information om datamängden ersätter du kolumnnamnen med siffror.

DataFrame:en är inläst som hr – använd konsolen för att utforska den. numpy är importerat som np.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Redigera och kör kod