開始使用免費開始

遺漏值

時間序列資料有時會有遺漏值,在 R 中以 NA 表示,知道它們的位置很有用。同時也要了解各種 R 函式如何處理遺漏值。有時你可能想忽略遺漏情況,但有時也會希望填補(插補)或估計遺漏值。

我們再次查看每月的 AirPassengers 資料集,但現在 1956 年的資料遺失。在這個練習中,你將探索這些遺漏資料的影響,並透過填補新資料來解決問題。

mean() 函式會計算樣本平均數,但只要存在任何 NA 值就會失敗。使用 mean(___, na.rm = TRUE) 在移除所有遺漏值後計算平均數。以觀察到的值之平均數去替代遺漏值是常見作法。當這個簡單的資料填補方法用在 AirPassengers 資料集上時,看起來足夠嗎?

本練習屬於課程

R 的時間序列分析

檢視課程

練習說明

  • 使用 plot() 繪製 AirPassengers 的簡單圖形。注意 1956 年的遺漏資料。
  • 使用 mean() 在移除遺漏值(na.rm = TRUE)後計算 AirPassengers 的樣本平均數。
  • 執行預先寫好的程式碼,把平均數填補到遺漏資料中。
  • 再次呼叫 plot(),重新繪製你剛填補後的 AirPassengers 資料。
  • 執行預先寫好的程式碼,把完整的 AirPassengers 資料加入到你的圖中。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Plot the AirPassengers data
plot(___)

# Compute the mean of AirPassengers


# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)

# Generate another plot of AirPassengers


# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)
編輯並執行程式碼