Aan de slagBegin gratis

Random Forest: modelleren

Net als gradient boosted trees zijn random forests een vorm van ensemblemodel. Ze gebruiken dus veel eenvoudigere modellen (opnieuw beslissingsbomen) en combineren die tot één beter model. In plaats van hetzelfde model iteratief te draaien, voeren random forests veel afzonderlijke modellen parallel uit, elk op een willekeurig gekozen subset van de gegevens, met een willekeurig gekozen subset van features. De uiteindelijke beslissingsboom doet vervolgens voorspellingen door de resultaten van de individuele modellen te aggregeren.

De random-forestfunctie van sparklyr heet ml_random_forest(). Het gebruik is precies hetzelfde als bij ml_gradient_boosted_trees() (zie de eerste oefening van dit hoofdstuk voor een herinnering aan de syntax).

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is al een Spark-verbinding voor je gemaakt als spark_conn. Een tibble die gekoppeld is aan de gecombineerde en gefilterde trackmetadata-/timbregegevens die in Spark zijn opgeslagen, is vooraf gedefinieerd als track_data_to_model_tbl.

  • Herhaal je jaarvoorspellingsanalyse, maar gebruik nu een random-forestmodel.
    • Haal de timbre-kolommen op uit track_data_to_model_tbl en ken het resultaat toe aan feature_colnames.
    • Maak de formule voor het model met reformulate().
    • Voer het random-forestmodel uit en ken het resultaat toe aan random_forest_model.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Code bewerken en uitvoeren