ÎncepețiÎncepe gratuit

Imputarea datelor sub interval cu date nabular

Este important să ținem evidența valorilor pe care le-am imputat. Altfel, este foarte dificil să evaluăm cât de bune sunt valorile imputate.

Vom exersa imputarea datelor și vom recrea vizualizările din seria anterioară de exerciții, imputând valorile sub intervalul datelor.

Acesta este un mod foarte util de a explora în continuare valorile lipsă și oferă, totodată, cadrul necesar pentru imputarea acestora.

Mai întâi, vom imputa datele sub interval folosind impute_below_all(), după care vom vizualiza datele. Observăm că, deși putem vedea unde se află valorile lipsă în acest caz, avem nevoie de o metodă pentru a le urmări. Tiparul de programare pentru urmărirea datelor lipsă ne poate ajuta în acest sens.

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă în R

Vezi cursul

Instrucțiuni pentru exercițiu

Folosind datele oceanbuoys:

  • Imputează sub interval cu impute_below_all().
  • Vizualizează noile valori lipsă cu wind_ew pe axa x și air_temp_c pe axa y.
  • Imputează și urmărește datele cu bind_shadow(), impute_below_all() și add_label_shadow().
  • Afișează graficul și inspectează valorile imputate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)

# Visualize the new missing values
ggplot(___, 
       aes(x = ___, y = ___)) +  
  geom_point()

# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>% 
  ___() %>% 
  ___()

# Look at the imputed values
___
Editează și rulează codul