CommencerCommencez gratuitement

Améliorer vos modèles

Vous avez précédemment construit une collection de modèles simples pour ajuster la life expectancy à partir de la variable year. Votre analyse a montré que certains de ces modèles s’ajustaient mal.

Dans cet exercice, vous allez construire des modèles de régression multiple pour chaque pays en utilisant toutes les variables disponibles. Vous souhaiterez peut-être comparer les performances des quatre modèles les moins bien ajustés ; leurs \(R^2\) ajustés sont fournis ci-dessous :

Country Adjusted \(R^2\)
Botswana -0.0060772
Lesotho -0.0169851
Zambia 0.1668999
Zimbabwe 0.2083979

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Construisez un modèle linéaire pour chaque pays en prédisant life_expectancy à partir de toutes les variables du jeu de données.
  • Ajoutez une colonne (fit) contenant les statistiques d’ajustement pour chaque modèle et simplifiez ce data frame.
  • Affichez le \(R^2\) ajusté dans fullmodel_perf pour les quatre pays du data frame worst_fit.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build a linear model for each country using all features
gap_fullmodel <- gap_nested %>% 
  mutate(model = map(data, ~lm(formula = ___, data = .x)))

fullmodel_perf <- gap_fullmodel %>% 
  # Extract the fit statistics of each model into data frames
  mutate(fit = map(model, ~___(.x))) %>% 
  # Simplify the fit data frames for each model
  unnest(___)
  
# View the performance for the four countries with the worst fitting four simple models you looked at before
fullmodel_perf %>% 
  ___(country %in% worst_fit$country) %>% 
  select(country, adj.r.squared)
Modifier et exécuter le code