Vizualizace vzorců chybějících hodnot
Procvičme si různé způsoby vizualizace vzorců chybějících hodnot:
gg_miss_upset()pro celkový přehled vzorců chybějících hodnot.gg_miss_fct()pro dataset, který obsahuje faktor zájmu: manželský stav.- a
gg_miss_span()pro prozkoumání chybějících hodnot v časové řadě.
Co si všímáš ve vztahu mezi chybějícími hodnotami a rozdělením dat do skupin?
Toto cvičení je součástí kurzu
Práce s chybějícími daty v R
Pokyny k cvičení
- Prozkoumej vzorec chybějících hodnot v datasetu
airqualitypomocí funkcegg_miss_upset(). - Pomocí funkce
gg_miss_fct()zjisti, jak se chybějící hodnoty v dataseturiskfactorsmění napříč proměnnoumarital. - Pomocí funkce
gg_miss_span()prozkoumej, jak se chybějící hodnoty v datasetupedestrianmění u proměnnéhourly_countspřes úsek délky 3000 (můžeš zkusit i jiné hodnoty v rozsahu 2000–5000). - Zahrnutím proměnné
monthdo argumentufacets délkou úseku 1000 prozkoumej její vliv nahourly_counts.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Using the airquality dataset, explore the missingness pattern using gg_miss_upset()
gg_miss_upset(airquality)
# With the riskfactors dataset, explore how the missingness changes across the marital variable using gg_miss_fct()
gg_miss_fct(x = riskfactors, fct = marital)
# Using the pedestrian dataset, explore how the missingness of hourly_counts changes over a span of 3000
gg_miss_span(pedestrian, var = ___, span_every = ___)
# Using the pedestrian dataset, explore the impact of month by faceting by month
# and explore how missingness changes for a span of 1000
____(___, var = ___ , span_every = ___, facet = ___)