缺失值
时间序列数据中有时会出现缺失值,在 R 中记为 NA。了解它们的位置很有用。同时,了解各类 R 函数如何处理缺失值也很重要。有时我们可能希望忽略缺失,但在其他情况下,我们可能需要对缺失值进行插补或估计。
我们再来看每月的 AirPassengers 数据集,但现在 1956 年的数据缺失。在本练习中,您将探索这些缺失数据带来的影响,并插补一些新数据来解决问题。
mean() 函数用来计算样本均值,但在存在任何 NA 值时会失败。请使用 mean(___, na.rm = TRUE) 在移除所有缺失值后计算均值。常见做法是用观测值的均值替换缺失值。将这种简单的插补方法应用到 AirPassengers 数据集时,您觉得是否足够合理?
本练习是课程的一部分
R 中的时间序列分析
练习说明
- 使用
plot()绘制AirPassengers的简单图形。注意 1956 年的数据缺失。 - 使用
mean()在移除缺失数据(na.rm = TRUE)后计算AirPassengers的样本均值。 - 运行预写代码,将均值插补到缺失数据中。
- 再次调用
plot(),重新绘制您刚插补后的AirPassengers数据。 - 运行预写代码,将完整的
AirPassengers数据添加到图中。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Plot the AirPassengers data
plot(___)
# Compute the mean of AirPassengers
# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)
# Generate another plot of AirPassengers
# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)