Imputace chybějících hodnot a vytvoření dummy proměnných
Po odhalení chybějících hodnot v datasetu attrition a zjištění, že chybí zcela náhodně (MCAR), se rozhodneš použít imputaci pomocí K nejbližších sousedů (KNN). Při konfiguraci svého recipe pro feature engineering se rozhodneš vytvořit dummy proměnné pro všechny nominální proměnné a aktualizovat roli proměnné ...1 na "ID", aby ses na ni mohl/a odkazovat v datasetu, aniž by ovlivňovala model.
Toto cvičení je součástí kurzu
Feature Engineering v R
Pokyny k cvičení
- Aktualizuj roli proměnné
...1na "ID". - Imputuj chybějící hodnoty u všech prediktorů.
- Vytvoř dummy proměnné pro všechny nominální prediktory.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
lr_model <- logistic_reg()
lr_recipe <-
recipe(Attrition ~., data = train) %>%
# Update the role of "...1" to "ID"
___(...1, new_role = "ID" ) %>%
# Impute values to all predictors where data are missing
step_impute_knn(___) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
lr_recipe