Random Forest : prédiction
Vous devez maintenant générer des prédictions avec votre modèle de random forest. La syntaxe est la même que pour le modèle de gradient boosted trees.
Cette activité fait partie du cours
Introduction à Spark avec sparklyr en R
Instructions de l’exercice
Une connexion Spark a été créée pour vous sous le nom spark_conn. Les tibbles associés aux ensembles d'entraînement et de test stockés dans Spark ont été prédéfinis comme track_data_to_model_tbl et track_data_to_predict_tbl, respectivement. Le modèle de random forest a été prédéfini sous random_forest_model.
- Définissez une variable
predictedqui contient les prédictions du modèle pour nos données de test.- Appelez
ml_predict()avec le modèle et les données de test comme arguments. Cette fonction génère des prédictions pour l'ensemble de test et les ajoute comme nouvelle colonne nomméeprediction.
- Appelez
- Définissez la variable
responsespour préparer les données en vue de comparer les réponses prédites aux réponses réelles :- Sélectionnez la colonne de réponse
year. - Collectez les résultats.
- Utilisez
mutate()pour ajouter les prédictions contenues danspredicted.
- Sélectionnez la colonne de réponse
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___