Visualisera imputerade värden i ett spridningsdiagram
Nu ska vi återskapa ett av de tidigare diagrammen från kapitel tre som använde geom_miss_point().
För att göra det behöver vi imputera data under datamängdens värdeintervall. Det är en särskild typ av imputering som används för att utforska data. Den illustrerar vad vi behöver öva på: hur man spårar saknade värden. För att imputera data under värdeintervallet använder vi funktionen impute_below_all().
Den här övningen är en del av kursen
Hantera saknade värden i R
Övningsinstruktioner
Använd datamängden oceanbuoys:
- Imputera och spåra de saknade värdena med
bind_shadow(),impute_below_all()ochadd_label_shadow(). - Visualisera sakningsmönstret för vind och lufttemperatur på x- respektive y-axeln, och färgkoda saknade lufttemperaturvärden med
air_temp_c_NA. - Visualisera luftfuktighet och lufttemperatur på x- respektive y-axeln, och färgkoda alla fall med saknade värden med variabeln
any_missing.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Impute and track the missing values
ocean_imp_track <- bind_shadow(___) %>%
impute_below_all() %>%
add_label_shadow()
# Visualize the missingness in wind and air temperature,
# coloring missing air temp values with air_temp_c_NA
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
geom_point()
# Visualize humidity and air temp, coloring any missing cases using the variable any_missing
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
geom_point()