ÎncepețiÎncepe gratuit

Random Forest: modelare

Ca și arborii cu gradient boosting, pădurile aleatoare (random forests) sunt un alt tip de model ansamblu. Adică folosesc mai multe modele mai simple (tot arbori de decizie) și le combină pentru a obține un model mai performant. În loc să ruleze același model în mod iterativ, pădurile aleatoare rulează mai multe modele independente în paralel, fiecare pe un subset ales aleatoriu din date și cu un subset ales aleatoriu de caracteristici. Arborele de decizie final face predicții prin agregarea rezultatelor din modelele individuale.

Funcția sparklyr pentru păduri aleatoare se numește ml_random_forest(). Modul de utilizare este identic cu cel al funcției ml_gradient_boosted_trees() (consultă primul exercițiu din acest capitol pentru a-ți reaminti sintaxa).

Acest exercițiu face parte din cursul

Introducere în Spark cu sparklyr în R

Vezi cursul

Instrucțiuni pentru exercițiu

O conexiune Spark a fost creată pentru tine sub numele spark_conn. Un tibble asociat datelor combinate și filtrate despre melodii (metadate și timbre), stocate în Spark, a fost predefinit ca track_data_to_model_tbl.

  • Repetă analiza de predicție a anului, de data aceasta folosind un model de tip random forest.
    • Extrage coloanele timbre din track_data_to_model_tbl și atribuie rezultatul variabilei feature_colnames.
    • Creează formula modelului folosind reformulate().
    • Rulează modelul random forest și atribuie rezultatul variabilei random_forest_model.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Editează și rulează codul