Масштабирование данных для лассо-регрессии
Перед обучением модели лассо-регрессии важно масштабировать данные, чтобы все признаки были сопоставимы между собой. Полный набор данных о продажах домов в округе Кинг, Калифорния, доступен в house_sales_df.
В этом упражнении вы отдельно масштабируете целевую переменную price до разбивки данных на обучающую и тестовую выборки. Это связано с особенностями работы рецептов tidymodels: преобразования целевой переменной не включаются в рецепт.
Пакеты tidyverse и tidymodels уже загружены.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Масштабируйте целевую переменную
priceвhouse_sales_dfс помощью функцииscale(). - Разбейте данные на обучающую и тестовую выборки, выделив 80% в обучающую.
- Создайте рецепт на основе обучающих данных для масштабирования всех числовых предикторов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Scale the target variable
house_sales_df <- ___ %>%
mutate(price = as.vector(___(___)))
# Create the training and testing sets
split <- ___(___, prop = ___)
train <- ___ %>% ___()
test <- ___ %>% ___()
# Create recipe to scale the predictors
lasso_recipe <-
___(___ ~ ., data = ___) %>%
___(___())