Random Forest: predizione
Ora devi generare alcune predizioni con il tuo modello di random forest. La sintassi è la stessa del modello di gradient boosted trees.
Questo esercizio fa parte del corso
Introduzione a Spark con sparklyr in R
Istruzioni dell'esercizio
Una connessione Spark è stata creata per te come spark_conn. Le tibbles collegate agli insiemi di dati di training e di test archiviati in Spark sono state predefinite rispettivamente come track_data_to_model_tbl e track_data_to_predict_tbl. Il modello di random forest è stato predefinito come random_forest_model.
- Definisci una variabile
predictedche contenga le predizioni del modello per i dati di test.- Chiama
ml_predict()passando come argomenti il modello e i dati di test. Questa funzione genererà le predizioni per l'insieme di test e le aggiungerà come nuova colonna chiamataprediction.
- Chiama
- Definisci la variabile
responsesper preparare i dati al confronto tra risposte previste e risposte reali:- Seleziona la colonna di risposta
year. - Colleziona i risultati.
- Usa
mutate()per aggiungere le predizioni contenute inpredicted.
- Seleziona la colonna di risposta
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___