Améliorer les modèles
Plus tôt, vous avez créé une collection de modèles simples pour ajuster l'espérance de vie à partir de la caractéristique year. Votre analyse précédente a montré que certains de ces modèles ne s'ajustaient pas très bien.
Dans cet exercice, vous allez construire des modèles de régression multiple pour chaque pays en utilisant toutes les caractéristiques disponibles. Vous pourriez vouloir comparer la performance des quatre modèles les moins performants; leurs \(R^2\) ajustés sont indiqués ci-dessous :
| Country | Adjusted \(R^2\) |
|---|---|
| Botswana | -0.0060772 |
| Lesotho | -0.0169851 |
| Zambia | 0.1668999 |
| Zimbabwe | 0.2083979 |
Cette activité fait partie du cours
Machine Learning dans le tidyverse
Instructions de l’exercice
- Construisez un modèle linéaire pour chaque pays afin de prédire
life_expectancyen utilisant toutes les caractéristiques du jeu de données. - Ajoutez une colonne (
fit) contenant les statistiques d'ajustement pour chaque modèle et simplifiez cette trame de données. - Affichez le \(R^2\) ajusté dans
fullmodel_perfpour les quatre pays du tableauworst_fit.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Build a linear model for each country using all features
gap_fullmodel <- gap_nested %>%
mutate(model = map(data, ~lm(formula = ___, data = .x)))
fullmodel_perf <- gap_fullmodel %>%
# Extract the fit statistics of each model into data frames
mutate(fit = map(model, ~___(.x))) %>%
# Simplify the fit data frames for each model
unnest(___)
# View the performance for the four countries with the worst fitting four simple models you looked at before
fullmodel_perf %>%
___(country %in% worst_fit$country) %>%
select(country, adj.r.squared)