Кодирование данных
Кодирование категориальных данных позволяет использовать их в алгоритмах машинного обучения. R кодирует факторы внутренне, однако для создания собственных моделей кодирование необходимо выполнять вручную.
В этом упражнении вы сначала построите линейную модель с помощью lm(), а затем шаг за шагом разработаете собственную модель.
При унитарном кодировании (one hot encoding) для каждого уровня создаётся отдельный столбец.

Обратите внимание: один из столбцов можно вывести из остальных (например, нули в столбцах «B» и «C» означают единицу в столбце «A»). Поэтому при линейной регрессии первый столбец можно исключить. Подробнее линейные модели мы рассмотрим в следующей главе.
Для унитарного кодирования используйте функцию dummyVars() из пакета caret.
Порядок применения: сначала создайте энкодер, затем преобразуйте набор данных:
encoder <- dummyVars(~ category, data = df)
predict(encoder, newdata = df)
Полные наблюдения из набора данных survey пакета MASS доступны в переменной survey.
Пакет caret уже загружен.
Это упражнение является частью курса
Практика статистических вопросов для интервью на R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Fit a linear model
lm(___ ~ Exer, data = ___)