НачатьНачать бесплатно

Обучение модели на тренировочных данных

Пришло время разделить данные на обучающую выборку для обучения модели и отдельную тестовую выборку для оценки её предсказательной силы. Прежде чем выполнить это разделение, мы случайным образом перемешаем строки: для этого извлечём 100% строк из house_prices без повторений и сохраним результат в house_prices_shuffled. Такой подход гарантирует, что обучающая и тестовая выборки будут сформированы случайно.

Это упражнение является частью курса

Моделирование данных в Tidyverse

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Set random number generator seed value for reproducibility
set.seed(76)

# Randomly reorder the rows
house_prices_shuffled <- house_prices %>% 
  sample_frac(size = 1, replace = FALSE)

# Train/test split
train <- house_prices_shuffled %>%
  slice(___:___)
test <- house_prices_shuffled %>%
  slice(___:___)
Редактировать и запускать код