Kom igångKom igång gratis

Använda hierarkier för kategoriska variabler

I den här övningen skapar och använder du hierarkier för att tillämpa datageneralisering på kolumnen bachelors i datasetet US Adult Income.

En inledande ordlista med hierarkier finns tillgänglig som hierarchies. Den innehåller tre kategorier för utbildningstyper: Primary, Secondary och Higher – var och en med en lista över motsvarande utbildningsvärden i datasetet. Du kan utforska den i den interaktiva konsolen.

Vi skapar en ny ordlista som håller den generaliserade utbildningsinformationen och använder den för att ersätta de ursprungliga värdena.

Datasetet finns tillgängligt som income_df.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Initiera education_hierarchy som en tom ordlista.
  • Komplettera den inre loopen så att utbildningstypen key tilldelas som värde. Till exempel {'Some-college': 'Higher education'}.
  • Tillämpa generaliseringen av utbildningshierarkin på kolumnen bachelors och tilldela resultatet till den nya kolumnen bachelors_generalized.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
Redigera och kör kod