Random Forest: prediktion
Nu ska du göra prediktioner med din random forest-modell. Syntaxen är densamma som för modellen med gradientboostade träd.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En Spark-anslutning har skapats åt dig som spark_conn. Tibbles kopplade till tränings- och testdatamängderna som lagrats i Spark har fördefinierade namn: track_data_to_model_tbl respektive track_data_to_predict_tbl. Random forest-modellen har fördefinieras som random_forest_model.
- Definiera en variabel
predictedsom innehåller modellens prediktioner för våra testdata.- Anropa
ml_predict()med modellen och testdata som argument. Den här funktionen genererar prediktioner för testdatamängden och lägger till dessa som en ny kolumn med namnetprediction.
- Anropa
- Definiera variabeln
responsesför att förbereda data för jämförelse mellan predikterade och faktiska responsvärden:- Välj responskolumnen
year. - Samla in resultaten.
- Använd
mutate()för att lägga till prediktionerna frånpredicted.
- Välj responskolumnen
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___