НачатьНачать бесплатно

Кодирование категориальных признаков

Иногда набор данных содержит числовые значения, которые представляют категориальный признак.

В наборе данных donors столбец wealth_rating использует числа для обозначения уровня благосостояния донора:

  • 0 = Неизвестно
  • 1 = Низкий
  • 2 = Средний
  • 3 = Высокий

В этом упражнении вы узнаете, как подготовить такой категориальный признак, и оцените его влияние на модель логистической регрессии. Фрейм данных donors уже доступен для работы.

Это упражнение является частью курса

Обучение с учителем в R: классификация

Посмотреть курс

Инструкции к упражнению

  • Создайте фактор wealth_levels на основе числового столбца wealth_rating, указав метки, как показано: передайте функции factor() нужный столбец, список уровней и список меток.
  • Используйте relevel(), чтобы сменить базовую категорию на Medium. Первым аргументом должен быть новый столбец типа factor.
  • Постройте модель логистической регрессии, используя столбец wealth_levels для предсказания donated, и выведите результат с помощью summary().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Convert the wealth rating to a factor
donors$wealth_levels <- ___(___, levels = ___, labels = ___)

# Use relevel() to change reference category
donors$wealth_levels <- ___(___, ref = ___)

# See how our factor coding impacts the model
summary(___)
Редактировать и запускать код