CommencerCommencez gratuitement

Construire et évaluer le meilleur modèle

Grâce à la validation croisée, vous avez identifié le meilleur modèle pour prédire life_expectancy à partir de toutes les variables de gapminder. Maintenant que vous avez sélectionné votre modèle, vous pouvez utiliser l’ensemble de données indépendant (testing_data) mis de côté pour estimer ses performances sur de nouvelles données.

Vous allez entraîner ce modèle sur l’ensemble des training_data et l’évaluer avec testing_data.

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez ranger() pour entraîner le modèle le plus performant (mtry = 4) sur toutes les données d’entraînement. Affectez-le à best_model.
  • Extrayez la colonne life_expectancy de testing_data et affectez-la à test_actual.
  • Prédisez life_expectancy avec best_model sur les données testing et affectez le résultat à test_predicted.
  • Calculez la MAE à partir des vecteurs test_actual et test_predicted.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build the model using all training data and the best performing parameter
best_model <- ranger(formula = ___, data = ___,
                     mtry = ___, num.trees = 100, seed = 42)

# Prepare the test_actual vector
test_actual <- testing_data$___

# Predict life_expectancy for the testing_data
test_predicted <- predict(___, ___)$predictions

# Calculate the test MAE
mae(___, ___)
Modifier et exécuter le code