Začněte nyníZačněte zdarma

Imputace dat pod rozsah s nabular daty

Chceme mít přehled o hodnotách, které jsme imputovali. Bez toho je velmi obtížné posoudit, jak dobře imputace dopadla.

Procvičíme si imputaci dat a znovu vytvoříme vizualizace z předchozí sady cvičení — tentokrát tak, že imputujeme hodnoty pod rozsah dat.

Jde o velmi užitečný způsob, jak dále zkoumat chybějící hodnoty, a zároveň poskytuje základ pro jejich imputaci.

Nejprve imputujeme data pod rozsah pomocí impute_below_all() a výsledek vizualizujeme. Všimneme si, že i když vidíme, kde se chybějící hodnoty nacházejí, potřebujeme způsob, jak je sledovat. Právě k tomu slouží programovací vzor pro sledování chybějících dat.

Toto cvičení je součástí kurzu

Práce s chybějícími daty v R

Zobrazit kurz

Pokyny k cvičení

Pracuj s daty oceanbuoys:

  • Imputuj hodnoty pod rozsah pomocí impute_below_all().
  • Vizualizuj nové chybějící hodnoty — wind_ew na ose x a air_temp_c na ose y.
  • Imputuj data a sleduj je pomocí bind_shadow(), impute_below_all() a add_label_shadow().
  • Zobraz graf a prozkoumej imputované hodnoty.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)

# Visualize the new missing values
ggplot(___, 
       aes(x = ___, y = ___)) +  
  geom_point()

# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>% 
  ___() %>% 
  ___()

# Look at the imputed values
___
Upravit a spustit kód