ПочатиПочніть безкоштовно

Відсутні значення

Іноді в часових рядах трапляються відсутні значення, які в R позначаються як NA, і корисно знати, де саме вони розташовані. Важливо також розуміти, як різні функції R обробляють пропуски. Іноді ми можемо захотіти їх ігнорувати, а іншим разом — виконати імпутацію або оцінити відсутні значення.

Знову розгляньмо місячний набір даних AirPassengers, але тепер дані за 1956 рік відсутні. У цій вправі ви дослідите наслідки таких пропусків і виконаєте імпутацію, щоб розв'язати проблему.

Функція mean() обчислює вибіркове середнє, але не працює за наявності будь-яких значень NA. Скористайтеся mean(___, na.rm = TRUE), щоб обчислити середнє з вилученням усіх відсутніх значень. Поширений підхід — замінити пропуски середнім спостережених значень. Чи виглядає така проста схема імпутації достатньою для набору даних AirPassengers?

Ця вправа є частиною курсу

Аналіз часових рядів в R

Переглянути курс

Інструкції до вправи

  • Використайте plot(), щоб побудувати простий графік AirPassengers. Зверніть увагу на відсутні дані за 1956 рік.
  • Скористайтеся mean(), щоб обчислити вибіркове середнє AirPassengers із вилученням пропусків (na.rm = TRUE).
  • Запустіть заздалегідь підготовлений код, щоб імпутувати середні значення у ваші пропуски.
  • Викличте plot() ще раз, щоб перепобудувати оновлені дані AirPassengers після імпутації.
  • Запустіть заздалегідь підготовлений код, щоб додати повні дані AirPassengers на ваш графік.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Plot the AirPassengers data
plot(___)

# Compute the mean of AirPassengers


# Impute mean values to NA in AirPassengers
AirPassengers[85:96] <- mean(AirPassengers, na.rm = ___)

# Generate another plot of AirPassengers


# Add the complete AirPassengers data to your plot
rm(AirPassengers)
points(AirPassengers, type = "l", col = 2, lty = 3)
Редагувати та запускати код