Vylepši své modely
Dříve jsi sestavil/a sadu jednoduchých modelů pro předpověď střední délky života pomocí příznaku year. Předchozí analýza ukázala, že některé z těchto modelů nevykazovaly dobrý fit.
V tomto cvičení sestavíš modely vícenásobné regrese pro každou zemi s využitím všech dostupných příznaků. Níže jsou pro srovnání uvedeny hodnoty upraveného \(R^2\) čtyř modelů s nejhorším fitem:
| Země | Upravené \(R^2\) |
|---|---|
| Botswana | -0.0060772 |
| Lesotho | -0.0169851 |
| Zambia | 0.1668999 |
| Zimbabwe | 0.2083979 |
Toto cvičení je součástí kurzu
Machine Learning in the Tidyverse
Pokyny k cvičení
- Sestav lineární model pro každou zemi, který předpovídá
life_expectancyna základě všech příznaků v datasetu. - Přidej sloupec (
fit) se statistikami kvality pro každý model a zjednodušší tento datový rámec. - Vypiš upravené \(R^2\) z
fullmodel_perfpro čtyři země z datového rámceworst_fit.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build a linear model for each country using all features
gap_fullmodel <- gap_nested %>%
mutate(model = map(data, ~lm(formula = ___, data = .x)))
fullmodel_perf <- gap_fullmodel %>%
# Extract the fit statistics of each model into data frames
mutate(fit = map(model, ~___(.x))) %>%
# Simplify the fit data frames for each model
unnest(___)
# View the performance for the four countries with the worst fitting four simple models you looked at before
fullmodel_perf %>%
___(country %in% worst_fit$country) %>%
select(country, adj.r.squared)