Imputace dat pod rozsah s nabular daty
Chceme mít přehled o hodnotách, které jsme imputovali. Bez toho je velmi obtížné posoudit, jak dobře imputace dopadla.
Procvičíme si imputaci dat a znovu vytvoříme vizualizace z předchozí sady cvičení — tentokrát tak, že imputujeme hodnoty pod rozsah dat.
Jde o velmi užitečný způsob, jak dále zkoumat chybějící hodnoty, a zároveň poskytuje základ pro jejich imputaci.
Nejprve imputujeme data pod rozsah pomocí impute_below_all() a výsledek vizualizujeme. Všimneme si, že i když vidíme, kde se chybějící hodnoty nacházejí, potřebujeme způsob, jak je sledovat. Právě k tomu slouží programovací vzor pro sledování chybějících dat.
Toto cvičení je součástí kurzu
Práce s chybějícími daty v R
Pokyny k cvičení
Pracuj s daty oceanbuoys:
- Imputuj hodnoty pod rozsah pomocí
impute_below_all(). - Vizualizuj nové chybějící hodnoty —
wind_ewna ose x aair_temp_cna ose y. - Imputuj data a sleduj je pomocí
bind_shadow(),impute_below_all()aadd_label_shadow(). - Zobraz graf a prozkoumej imputované hodnoty.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)
# Visualize the new missing values
ggplot(___,
aes(x = ___, y = ___)) +
geom_point()
# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>%
___() %>%
___()
# Look at the imputed values
___