Kom igångKom igång gratis

Random Forest: modellering

Precis som gradientförstärkta träd är random forests en annan typ av ensemblemodell. Det innebär att de kombinerar många enklare modeller (återigen beslutsträd) till en enda bättre modell. I stället för att köra samma modell iterativt tränar random forests många separata modeller parallellt – var och en på ett slumpmässigt valt urval av data och med ett slumpmässigt valt urval av särdrag. Det slutliga beslutet fattas sedan genom att aggregera resultaten från de enskilda modellerna.

Random forest-funktionen i sparklyr heter ml_random_forest(). Den används på exakt samma sätt som ml_gradient_boosted_trees() (se den första övningen i det här kapitlet för en påminnelse om syntaxen).

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till den kombinerade och filtrerade spår-metadata/timbre-datan som lagrats i Spark har fördefinieras som track_data_to_model_tbl.

  • Upprepa din analys för att förutsäga utgivningsår, men använd den här gången en random forest-modell.
    • Hämta timbre-kolumnerna från track_data_to_model_tbl och tilldela resultatet till feature_colnames.
    • Skapa formeln för modellen med hjälp av reformulate().
    • Kör random forest-modellen och tilldela resultatet till random_forest_model.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Redigera och kör kod