Пропущенные значения
В данных временных рядов иногда встречаются пропущенные значения, которые в R обозначаются как NA. Важно уметь находить их в данных и понимать, как с ними работают различные функции R. В одних случаях пропуски можно игнорировать, в других — требуется их заполнить или оценить.
Рассмотрим снова месячный набор данных AirPassengers, но теперь данные за 1956 год отсутствуют. В этом упражнении вы изучите последствия пропущенных данных и выполните простую импутацию, чтобы восполнить пробелы.
Функция mean() вычисляет выборочное среднее, однако при наличии значений NA она возвращает NA. Используйте mean(___, na.rm = TRUE), чтобы вычислить среднее с удалением всех пропущенных значений. Распространённый способ заполнения пропусков — подстановка среднего по наблюдаемым значениям. Посмотрим, насколько этот простой подход подходит для набора данных AirPassengers.
Это упражнение является частью курса
Анализ временных рядов в R
Инструкции к упражнению
- С помощью функции
plot()постройте простой графикAirPassengers. Обратите внимание на отсутствующие данные за 1956 год. - С помощью функции
mean()вычислите выборочное среднееAirPassengersс удалением пропущенных значений (na.rm = TRUE). - Запустите готовый код, чтобы заполнить пропуски вычисленным средним значением.
- Снова вызовите
plot(), чтобы построить обновлённый графикAirPassengersс заполненными пропусками. - Запустите готовый код, чтобы добавить на график полные данные
AirPassengers.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Plot the AirPassengers data
plot(___)
# Compute the mean of AirPassengers
# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)
# Generate another plot of AirPassengers
# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)