Imputera saknade värden och skapa dummyvariabler
Efter att ha identifierat saknade värden i datamängden attrition och fastställt att de saknas helt slumpmässigt (MCAR), väljer du att använda K Nearest Neighbors (KNN) för imputering. När du konfigurerar ditt recipe för feature engineering bestämmer du dig för att skapa dummyvariabler för alla nominella variabler och uppdatera rollen för variabeln ...1 till "ID", så att du kan behålla den i datamängden som referens utan att den påverkar modellen.
Den här övningen är en del av kursen
Feature Engineering i R
Övningsinstruktioner
- Uppdatera rollen för
...1till "ID". - Imputera värden för alla prediktorer där data saknas.
- Skapa dummyvariabler för alla nominella prediktorer.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
lr_model <- logistic_reg()
lr_recipe <-
recipe(Attrition ~., data = train) %>%
# Update the role of "...1" to "ID"
___(...1, new_role = "ID" ) %>%
# Impute values to all predictors where data are missing
step_impute_knn(___) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
lr_recipe