Random Forest: modellazione
Come gli alberi potenziati con gradienti (gradient boosted trees), le random forest sono un altro tipo di ensemble model. In altre parole, usano molti modelli più semplici (ancora una volta alberi decisionali) e li combinano per ottenere un unico modello migliore. Invece di eseguire ripetutamente lo stesso modello, le random forest eseguono molti modelli separati in parallelo, ciascuno su un sottoinsieme casuale dei dati e con un sottoinsieme casuale di feature. Poi l’albero decisionale finale effettua le previsioni aggregando i risultati dei singoli modelli.
La funzione di random forest di sparklyr si chiama ml_random_forest(). Il suo utilizzo è identico a ml_gradient_boosted_trees() (vedi il primo esercizio di questo capitolo per un promemoria sulla sintassi).
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
È già stata creata per te una connessione Spark come spark_conn. Una tibble collegata ai metadati dei brani e ai dati di timbro uniti e filtrati, archiviati in Spark, è stata predefinita come track_data_to_model_tbl.
- Ripeti l’analisi di previsione dell’anno, questa volta usando un modello random forest.
- Ottieni le colonne
timbredatrack_data_to_model_tble assegna il risultato afeature_colnames. - Crea la formula per il modello usando
reformulate(). - Esegui il modello random forest e assegna il risultato a
random_forest_model.
- Ottieni le colonne
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___