Construire et évaluer le meilleur modèle
Grâce à la validation croisée, vous avez identifié le meilleur modèle pour prédire life_expectancy à partir de toutes les variables de gapminder. Maintenant que vous avez sélectionné votre modèle, vous pouvez utiliser l’ensemble de données indépendant (testing_data) mis de côté pour estimer ses performances sur de nouvelles données.
Vous allez entraîner ce modèle sur l’ensemble des training_data et l’évaluer avec testing_data.
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Utilisez
ranger()pour entraîner le modèle le plus performant (mtry = 4) sur toutes les données d’entraînement. Affectez-le àbest_model. - Extrayez la colonne
life_expectancydetesting_dataet affectez-la àtest_actual. - Prédisez
life_expectancyavecbest_modelsur les donnéestestinget affectez le résultat àtest_predicted. - Calculez la MAE à partir des vecteurs
test_actualettest_predicted.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build the model using all training data and the best performing parameter
best_model <- ranger(formula = ___, data = ___,
mtry = ___, num.trees = 100, seed = 42)
# Prepare the test_actual vector
test_actual <- testing_data$___
# Predict life_expectancy for the testing_data
test_predicted <- predict(___, ___)$predictions
# Calculate the test MAE
mae(___, ___)