ПочатиПочніть безкоштовно

Обробка пропущених даних

Деякі потенційні донори мають пропущені дані у полі age. На жаль, R виключатиме всі випадки з NA під час побудови регресійної моделі.

Один зі способів — замінити, або імпутувати, пропущені значення на оцінені. Після цього варто також створити індикатор пропуску, щоб змоделювати ймовірність того, що випадки з пропущеними даними в чомусь відрізняються від тих, де пропусків немає.

Датафрейм donors завантажено у ваш робочий простір.

Ця вправа є частиною курсу

Наглядове навчання в R: Класифікація

Переглянути курс

Інструкції до вправи

  • Застосуйте summary() до donors$age, щоб знайти середній вік потенційних донорів без пропусків.
  • Використайте ifelse() і тест is.na(donors$age), щоб імпутувати середнє значення (округлене до 2 знаків після коми) для випадків із пропущеним age. Обов'язково також ігноруйте NA.
  • Створіть бінарну фіктивну змінну з назвою missing_age, що позначає наявність пропущених даних, використавши ще один виклик ifelse() і той самий тест.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Find the average age among non-missing values
summary(___)

# Impute missing age values with the mean age
donors$imputed_age <- ifelse(___)

# Create missing value indicator for age
donors$missing_age <- ___
Редагувати та запускати код