Random Forest: voorspelling
Nu ga je voorspellingen maken met je random forest-model. De syntax is hetzelfde als bij het gradient boosted trees-model.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Er is een Spark-verbinding voor je aangemaakt als spark_conn. Tibbles gekoppeld aan de trainings- en testgegevenssets die in Spark zijn opgeslagen, zijn respectievelijk vooraf gedefinieerd als track_data_to_model_tbl en track_data_to_predict_tbl. Het random forest-model is vooraf gedefinieerd als random_forest_model.
- Definieer een variabele
predicteddie de voorspellingen van het model voor onze testgegevens bevat.- Roep
ml_predict()aan met het model en de testgegevens als argumenten. Deze functie genereert voorspellingen voor de testgegevensset en voegt die toe als een nieuwe kolom met de naamprediction.
- Roep
- Definieer de variabele
responsesom de gegevens voor te bereiden om voorspelde responses te vergelijken met de werkelijke responses:- Selecteer de responskolom
year. - Verzamel de resultaten.
- Gebruik
mutate()om de voorspellingen uitpredictedtoe te voegen.
- Selecteer de responskolom
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___