开始使用免费开始使用

缺失值

时间序列数据中有时会出现缺失值,在 R 中记为 NA。了解它们的位置很有用。同时,了解各类 R 函数如何处理缺失值也很重要。有时我们可能希望忽略缺失,但在其他情况下,我们可能需要对缺失值进行插补或估计。

我们再来看每月的 AirPassengers 数据集,但现在 1956 年的数据缺失。在本练习中,您将探索这些缺失数据带来的影响,并插补一些新数据来解决问题。

mean() 函数用来计算样本均值,但在存在任何 NA 值时会失败。请使用 mean(___, na.rm = TRUE) 在移除所有缺失值后计算均值。常见做法是用观测值的均值替换缺失值。将这种简单的插补方法应用到 AirPassengers 数据集时,您觉得是否足够合理?

本练习是课程的一部分

R 中的时间序列分析

查看课程

练习说明

  • 使用 plot() 绘制 AirPassengers 的简单图形。注意 1956 年的数据缺失。
  • 使用 mean() 在移除缺失数据(na.rm = TRUE)后计算 AirPassengers 的样本均值。
  • 运行预写代码,将均值插补到缺失数据中。
  • 再次调用 plot(),重新绘制您刚插补后的 AirPassengers 数据。
  • 运行预写代码,将完整的 AirPassengers 数据添加到图中。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Plot the AirPassengers data
plot(___)

# Compute the mean of AirPassengers


# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)

# Generate another plot of AirPassengers


# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)
编辑并运行代码