Random Forest: modelleren
Net als gradient boosted trees zijn random forests een vorm van ensemblemodel. Ze gebruiken dus veel eenvoudigere modellen (opnieuw beslissingsbomen) en combineren die tot één beter model. In plaats van hetzelfde model iteratief te draaien, voeren random forests veel afzonderlijke modellen parallel uit, elk op een willekeurig gekozen subset van de gegevens, met een willekeurig gekozen subset van features. De uiteindelijke beslissingsboom doet vervolgens voorspellingen door de resultaten van de individuele modellen te aggregeren.
De random-forestfunctie van sparklyr heet ml_random_forest(). Het gebruik is precies hetzelfde als bij ml_gradient_boosted_trees() (zie de eerste oefening van dit hoofdstuk voor een herinnering aan de syntax).
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is al een Spark-verbinding voor je gemaakt als spark_conn. Een tibble die gekoppeld is aan de gecombineerde en gefilterde trackmetadata-/timbregegevens die in Spark zijn opgeslagen, is vooraf gedefinieerd als track_data_to_model_tbl.
- Herhaal je jaarvoorspellingsanalyse, maar gebruik nu een random-forestmodel.
- Haal de
timbre-kolommen op uittrack_data_to_model_tblen ken het resultaat toe aanfeature_colnames. - Maak de formule voor het model met
reformulate(). - Voer het random-forestmodel uit en ken het resultaat toe aan
random_forest_model.
- Haal de
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___