Använda hierarkier för kategoriska variabler
I den här övningen skapar och använder du hierarkier för att tillämpa datageneralisering på kolumnen bachelors i datasetet US Adult Income.
En inledande ordlista med hierarkier finns tillgänglig som hierarchies. Den innehåller tre kategorier för utbildningstyper: Primary, Secondary och Higher – var och en med en lista över motsvarande utbildningsvärden i datasetet. Du kan utforska den i den interaktiva konsolen.
Vi skapar en ny ordlista som håller den generaliserade utbildningsinformationen och använder den för att ersätta de ursprungliga värdena.
Datasetet finns tillgängligt som income_df.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Övningsinstruktioner
- Initiera
education_hierarchysom en tom ordlista. - Komplettera den inre loopen så att utbildningstypen
keytilldelas som värde. Till exempel{'Some-college': 'Higher education'}. - Tillämpa generaliseringen av utbildningshierarkin på kolumnen
bachelorsoch tilldela resultatet till den nya kolumnenbachelors_generalized.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())