НачатьНачать бесплатно

Кодирование данных

Кодирование категориальных данных позволяет использовать их в алгоритмах машинного обучения. R кодирует факторы внутренне, однако для создания собственных моделей кодирование необходимо выполнять вручную.

В этом упражнении вы сначала построите линейную модель с помощью lm(), а затем шаг за шагом разработаете собственную модель.

При унитарном кодировании (one hot encoding) для каждого уровня создаётся отдельный столбец.

Обратите внимание: один из столбцов можно вывести из остальных (например, нули в столбцах «B» и «C» означают единицу в столбце «A»). Поэтому при линейной регрессии первый столбец можно исключить. Подробнее линейные модели мы рассмотрим в следующей главе.

Для унитарного кодирования используйте функцию dummyVars() из пакета caret.

Порядок применения: сначала создайте энкодер, затем преобразуйте набор данных:

encoder <- dummyVars(~ category, data = df)
predict(encoder, newdata = df)

Полные наблюдения из набора данных survey пакета MASS доступны в переменной survey. Пакет caret уже загружен.

Это упражнение является частью курса

Практика статистических вопросов для интервью на R

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Fit a linear model
lm(___ ~ Exer, data = ___)
Редактировать и запускать код