Random Forest: modelare
Ca și arborii cu gradient boosting, pădurile aleatoare (random forests) sunt un alt tip de model ansamblu. Adică folosesc mai multe modele mai simple (tot arbori de decizie) și le combină pentru a obține un model mai performant. În loc să ruleze același model în mod iterativ, pădurile aleatoare rulează mai multe modele independente în paralel, fiecare pe un subset ales aleatoriu din date și cu un subset ales aleatoriu de caracteristici. Arborele de decizie final face predicții prin agregarea rezultatelor din modelele individuale.
Funcția sparklyr pentru păduri aleatoare se numește ml_random_forest(). Modul de utilizare este identic cu cel al funcției ml_gradient_boosted_trees() (consultă primul exercițiu din acest capitol pentru a-ți reaminti sintaxa).
Acest exercițiu face parte din cursul
Introducere în Spark cu sparklyr în R
Instrucțiuni pentru exercițiu
O conexiune Spark a fost creată pentru tine sub numele spark_conn. Un tibble asociat datelor combinate și filtrate despre melodii (metadate și timbre), stocate în Spark, a fost predefinit ca track_data_to_model_tbl.
- Repetă analiza de predicție a anului, de data aceasta folosind un model de tip random forest.
- Extrage coloanele
timbredintrack_data_to_model_tblși atribuie rezultatul variabileifeature_colnames. - Creează formula modelului folosind
reformulate(). - Rulează modelul random forest și atribuie rezultatul variabilei
random_forest_model.
- Extrage coloanele
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___