Кодирование категориальных признаков
Иногда набор данных содержит числовые значения, которые представляют категориальный признак.
В наборе данных donors столбец wealth_rating использует числа для обозначения уровня благосостояния донора:
- 0 = Неизвестно
- 1 = Низкий
- 2 = Средний
- 3 = Высокий
В этом упражнении вы узнаете, как подготовить такой категориальный признак, и оцените его влияние на модель логистической регрессии. Фрейм данных donors уже доступен для работы.
Это упражнение является частью курса
Обучение с учителем в R: классификация
Инструкции к упражнению
- Создайте фактор
wealth_levelsна основе числового столбцаwealth_rating, указав метки, как показано: передайте функцииfactor()нужный столбец, список уровней и список меток. - Используйте
relevel(), чтобы сменить базовую категорию наMedium. Первым аргументом должен быть новый столбец типаfactor. - Постройте модель логистической регрессии, используя столбец
wealth_levelsдля предсказанияdonated, и выведите результат с помощьюsummary().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Convert the wealth rating to a factor
donors$wealth_levels <- ___(___, levels = ___, labels = ___)
# Use relevel() to change reference category
donors$wealth_levels <- ___(___, ref = ___)
# See how our factor coding impacts the model
summary(___)