НачатьНачать бесплатно

Пропущенные значения

В данных временных рядов иногда встречаются пропущенные значения, которые в R обозначаются как NA. Важно уметь находить их в данных и понимать, как с ними работают различные функции R. В одних случаях пропуски можно игнорировать, в других — требуется их заполнить или оценить.

Рассмотрим снова месячный набор данных AirPassengers, но теперь данные за 1956 год отсутствуют. В этом упражнении вы изучите последствия пропущенных данных и выполните простую импутацию, чтобы восполнить пробелы.

Функция mean() вычисляет выборочное среднее, однако при наличии значений NA она возвращает NA. Используйте mean(___, na.rm = TRUE), чтобы вычислить среднее с удалением всех пропущенных значений. Распространённый способ заполнения пропусков — подстановка среднего по наблюдаемым значениям. Посмотрим, насколько этот простой подход подходит для набора данных AirPassengers.

Это упражнение является частью курса

Анализ временных рядов в R

Посмотреть курс

Инструкции к упражнению

  • С помощью функции plot() постройте простой график AirPassengers. Обратите внимание на отсутствующие данные за 1956 год.
  • С помощью функции mean() вычислите выборочное среднее AirPassengers с удалением пропущенных значений (na.rm = TRUE).
  • Запустите готовый код, чтобы заполнить пропуски вычисленным средним значением.
  • Снова вызовите plot(), чтобы построить обновлённый график AirPassengers с заполненными пропусками.
  • Запустите готовый код, чтобы добавить на график полные данные AirPassengers.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Plot the AirPassengers data
plot(___)

# Compute the mean of AirPassengers


# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)

# Generate another plot of AirPassengers


# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)
Редактировать и запускать код