ÎncepețiÎncepe gratuit

Pregătirea datelor despre angajați pentru publicare în siguranță

Când lucrezi cu date reale, trebuie să te asiguri că informațiile personale ale clienților sau ale altor persoane nu pot fi urmărite sau expuse. În acest exercițiu, vei folosi o versiune simplificată a setului de date IBM HR Analytics Employee pentru a exersa tehnici de suprimare și generalizare.

Pentru a evita scurgerea de informații despre setul de date, vei înlocui numele coloanelor cu numere.

DataFrame-ul este încărcat ca hr; folosește consola pentru a-l explora. numpy este importat ca np.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Editează și rulează codul