Pregătirea datelor despre angajați pentru publicare în siguranță
Când lucrezi cu date reale, trebuie să te asiguri că informațiile personale ale clienților sau ale altor persoane nu pot fi urmărite sau expuse. În acest exercițiu, vei folosi o versiune simplificată a setului de date IBM HR Analytics Employee pentru a exersa tehnici de suprimare și generalizare.
Pentru a evita scurgerea de informații despre setul de date, vei înlocui numele coloanelor cu numere.
DataFrame-ul este încărcat ca hr; folosește consola pentru a-l explora. numpy este importat ca np.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____