Předzpracování
Čas na feature engineering! Potřebuješ sestavit recept, který se postará o neinformativní, ale potenciálně užitečné proměnné – například ID pozorování – a zároveň vyřeší chybějící hodnoty. Je to také příležitost transformovat některé prediktory: normalizovat numerické příznaky a vytvořit dummy proměnné pro kategorické.
Dataset attrition a rozdělení train a test, která jsi vytvořil/a v předchozím cvičení, jsou dostupné v tvém prostředí.
Toto cvičení je součástí kurzu
Feature Engineering v R
Pokyny k cvičení
- Normalizuj všechny numerické příznaky.
- Imputuj chybějící hodnoty pomocí algoritmu imputace
knn. - Vytvoř dummy proměnné pro všechny nominální prediktory.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
recipe <- recipe(Attrition ~ ., data = train) %>%
update_role(...1, new_role = "ID") %>%
# Normalize all numeric features
___(all_numeric_predictors()) %>%
# Impute missing values using the knn imputation algorithm
___(all_predictors()) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
recipe