Sestavení modelu náhodného lesa
Teď použiješ stejná data z křížové validace k sestavení (pomocí train) a vyhodnocení (pomocí validate) náhodných lesů pro každý oddíl. Protože pracuješ se stejnými oddíly křížové validace jako u regresních modelů, můžeš výkon obou modelů přímo porovnat.
Poznámka: Počet stromů v náhodném lese omezíme na 100, aby trénování proběhlo v rozumném čase. Výchozí počet stromů pro ranger() je 500.
Toto cvičení je součástí kurzu
Machine Learning in the Tidyverse
Pokyny k cvičení
- Pomocí
ranger()sestav model náhodného lesa, který předpovídálife_expectancyna základě všech příznaků vtrainpro každý oddíl křížové validace. - Přidej nový sloupec
validate_predicteds předpověďmilife_expectancypro pozorování vvalidatepomocí právě sestavených modelů náhodného lesa.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))