НачатьНачать бесплатно

Масштабирование данных для лассо-регрессии

Перед обучением модели лассо-регрессии важно масштабировать данные, чтобы все признаки были сопоставимы между собой. Полный набор данных о продажах домов в округе Кинг, Калифорния, доступен в house_sales_df.

В этом упражнении вы отдельно масштабируете целевую переменную price до разбивки данных на обучающую и тестовую выборки. Это связано с особенностями работы рецептов tidymodels: преобразования целевой переменной не включаются в рецепт.

Пакеты tidyverse и tidymodels уже загружены.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Масштабируйте целевую переменную price в house_sales_df с помощью функции scale().
  • Разбейте данные на обучающую и тестовую выборки, выделив 80% в обучающую.
  • Создайте рецепт на основе обучающих данных для масштабирования всех числовых предикторов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Scale the target variable
house_sales_df <-  ___ %>% 
  mutate(price = as.vector(___(___)))

# Create the training and testing sets
split <- ___(___, prop = ___)
train <- ___ %>% ___()
test <-  ___ %>% ___()

# Create recipe to scale the predictors
lasso_recipe <- 
  ___(___ ~ ., data = ___) %>% 
  ___(___()) 
Редактировать и запускать код