Random Forest: modellering
Precis som gradientförstärkta träd är random forests en annan typ av ensemblemodell. Det innebär att de kombinerar många enklare modeller (återigen beslutsträd) till en enda bättre modell. I stället för att köra samma modell iterativt tränar random forests många separata modeller parallellt – var och en på ett slumpmässigt valt urval av data och med ett slumpmässigt valt urval av särdrag. Det slutliga beslutet fattas sedan genom att aggregera resultaten från de enskilda modellerna.
Random forest-funktionen i sparklyr heter ml_random_forest(). Den används på exakt samma sätt som ml_gradient_boosted_trees() (se den första övningen i det här kapitlet för en påminnelse om syntaxen).
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. En tibble kopplad till den kombinerade och filtrerade spår-metadata/timbre-datan som lagrats i Spark har fördefinieras som track_data_to_model_tbl.
- Upprepa din analys för att förutsäga utgivningsår, men använd den här gången en random forest-modell.
- Hämta
timbre-kolumnerna fråntrack_data_to_model_tbloch tilldela resultatet tillfeature_colnames. - Skapa formeln för modellen med hjälp av
reformulate(). - Kör random forest-modellen och tilldela resultatet till
random_forest_model.
- Hämta
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___