遺漏值
時間序列資料有時會有遺漏值,在 R 中以 NA 表示,知道它們的位置很有用。同時也要了解各種 R 函式如何處理遺漏值。有時你可能想忽略遺漏情況,但有時也會希望填補(插補)或估計遺漏值。
我們再次查看每月的 AirPassengers 資料集,但現在 1956 年的資料遺失。在這個練習中,你將探索這些遺漏資料的影響,並透過填補新資料來解決問題。
mean() 函式會計算樣本平均數,但只要存在任何 NA 值就會失敗。使用 mean(___, na.rm = TRUE) 在移除所有遺漏值後計算平均數。以觀察到的值之平均數去替代遺漏值是常見作法。當這個簡單的資料填補方法用在 AirPassengers 資料集上時,看起來足夠嗎?
本練習屬於課程
R 的時間序列分析
練習說明
- 使用
plot()繪製AirPassengers的簡單圖形。注意 1956 年的遺漏資料。 - 使用
mean()在移除遺漏值(na.rm = TRUE)後計算AirPassengers的樣本平均數。 - 執行預先寫好的程式碼,把平均數填補到遺漏資料中。
- 再次呼叫
plot(),重新繪製你剛填補後的AirPassengers資料。 - 執行預先寫好的程式碼,把完整的
AirPassengers資料加入到你的圖中。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Plot the AirPassengers data
plot(___)
# Compute the mean of AirPassengers
# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)
# Generate another plot of AirPassengers
# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)