Chybějící hodnoty
V datech časových řad se někdy vyskytují chybějící hodnoty, v R označované jako NA. Hodí se vědět, kde se nacházejí, a také jak s nimi různé R funkce pracují. Někdy chybějící hodnoty jednoduše ignorujeme, jindy je chceme imputovat – tedy odhadnout a doplnit.
Podívejme se znovu na měsíční dataset AirPassengers, tentokrát s tím, že data za rok 1956 chybí. V tomto cvičení prozkoumáš, jaký vliv tato chybějící data mají, a zkusíš je imputovat.
Funkce mean() vypočítá výběrový průměr, ale selže, pokud data obsahují hodnoty NA. Pro výpočet průměru bez chybějících hodnot použij mean(___, na.rm = TRUE). Chybějící hodnoty se běžně nahrazují průměrem dostupných pozorování. Myslíš, že tato jednoduchá metoda imputace dává smysl pro dataset AirPassengers?
Toto cvičení je součástí kurzu
Analýza časových řad v R
Pokyny k cvičení
- Pomocí
plot()zobraz jednoduchý graf datasetuAirPassengers. Všimni si chybějících dat za rok 1956. - Pomocí
mean()vypočítej výběrový průměr datasetuAirPassengersbez chybějících hodnot (na.rm = TRUE). - Spusť předpřipravený kód, který doplní průměrné hodnoty na místa chybějících dat.
- Zavolej
plot()znovu a zobraz aktualizovaný datasetAirPassengerss imputovanými hodnotami. - Spusť předpřipravený kód, který do grafu přidá kompletní data
AirPassengers.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Plot the AirPassengers data
plot(___)
# Compute the mean of AirPassengers
# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)
# Generate another plot of AirPassengers
# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)