Začněte nyníZačněte zdarma

Chybějící hodnoty

V datech časových řad se někdy vyskytují chybějící hodnoty, v R označované jako NA. Hodí se vědět, kde se nacházejí, a také jak s nimi různé R funkce pracují. Někdy chybějící hodnoty jednoduše ignorujeme, jindy je chceme imputovat – tedy odhadnout a doplnit.

Podívejme se znovu na měsíční dataset AirPassengers, tentokrát s tím, že data za rok 1956 chybí. V tomto cvičení prozkoumáš, jaký vliv tato chybějící data mají, a zkusíš je imputovat.

Funkce mean() vypočítá výběrový průměr, ale selže, pokud data obsahují hodnoty NA. Pro výpočet průměru bez chybějících hodnot použij mean(___, na.rm = TRUE). Chybějící hodnoty se běžně nahrazují průměrem dostupných pozorování. Myslíš, že tato jednoduchá metoda imputace dává smysl pro dataset AirPassengers?

Toto cvičení je součástí kurzu

Analýza časových řad v R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí plot() zobraz jednoduchý graf datasetu AirPassengers. Všimni si chybějících dat za rok 1956.
  • Pomocí mean() vypočítej výběrový průměr datasetu AirPassengers bez chybějících hodnot (na.rm = TRUE).
  • Spusť předpřipravený kód, který doplní průměrné hodnoty na místa chybějících dat.
  • Zavolej plot() znovu a zobraz aktualizovaný dataset AirPassengers s imputovanými hodnotami.
  • Spusť předpřipravený kód, který do grafu přidá kompletní data AirPassengers.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Plot the AirPassengers data
plot(___)

# Compute the mean of AirPassengers


# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)

# Generate another plot of AirPassengers


# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)
Upravit a spustit kód