Améliorer vos modèles
Vous avez précédemment construit une collection de modèles simples pour ajuster la life expectancy à partir de la variable year. Votre analyse a montré que certains de ces modèles s’ajustaient mal.
Dans cet exercice, vous allez construire des modèles de régression multiple pour chaque pays en utilisant toutes les variables disponibles. Vous souhaiterez peut-être comparer les performances des quatre modèles les moins bien ajustés ; leurs \(R^2\) ajustés sont fournis ci-dessous :
| Country | Adjusted \(R^2\) |
|---|---|
| Botswana | -0.0060772 |
| Lesotho | -0.0169851 |
| Zambia | 0.1668999 |
| Zimbabwe | 0.2083979 |
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Construisez un modèle linéaire pour chaque pays en prédisant
life_expectancyà partir de toutes les variables du jeu de données. - Ajoutez une colonne (
fit) contenant les statistiques d’ajustement pour chaque modèle et simplifiez ce data frame. - Affichez le \(R^2\) ajusté dans
fullmodel_perfpour les quatre pays du data frameworst_fit.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build a linear model for each country using all features
gap_fullmodel <- gap_nested %>%
mutate(model = map(data, ~lm(formula = ___, data = .x)))
fullmodel_perf <- gap_fullmodel %>%
# Extract the fit statistics of each model into data frames
mutate(fit = map(model, ~___(.x))) %>%
# Simplify the fit data frames for each model
unnest(___)
# View the performance for the four countries with the worst fitting four simple models you looked at before
fullmodel_perf %>%
___(country %in% worst_fit$country) %>%
select(country, adj.r.squared)