Aan de slagBegin gratis

Random Forest: voorspelling

Nu ga je voorspellingen maken met je random forest-model. De syntax is hetzelfde als bij het gradient boosted trees-model.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Er is een Spark-verbinding voor je aangemaakt als spark_conn. Tibbles gekoppeld aan de trainings- en testgegevenssets die in Spark zijn opgeslagen, zijn respectievelijk vooraf gedefinieerd als track_data_to_model_tbl en track_data_to_predict_tbl. Het random forest-model is vooraf gedefinieerd als random_forest_model.

  • Definieer een variabele predicted die de voorspellingen van het model voor onze testgegevens bevat.
    • Roep ml_predict() aan met het model en de testgegevens als argumenten. Deze functie genereert voorspellingen voor de testgegevensset en voegt die toe als een nieuwe kolom met de naam prediction.
  • Definieer de variabele responses om de gegevens voor te bereiden om voorspelde responses te vergelijken met de werkelijke responses:
    • Selecteer de responskolom year.
    • Verzamel de resultaten.
    • Gebruik mutate() om de voorspellingen uit predicted toe te voegen.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model

# Predict the responses for the testing data
predicted <- ml_predict(
      ___,
      ___) %>% pull(prediction)

# Create a response vs. actual dataset
responses <- ___
Code bewerken en uitvoeren