Обучение модели на тренировочных данных
Пришло время разделить данные на обучающую выборку для обучения модели и отдельную тестовую выборку для оценки её предсказательной силы. Прежде чем выполнить это разделение, мы случайным образом перемешаем строки: для этого извлечём 100% строк из house_prices без повторений и сохраним результат в house_prices_shuffled. Такой подход гарантирует, что обучающая и тестовая выборки будут сформированы случайно.
Это упражнение является частью курса
Моделирование данных в Tidyverse
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set random number generator seed value for reproducibility
set.seed(76)
# Randomly reorder the rows
house_prices_shuffled <- house_prices %>%
sample_frac(size = 1, replace = FALSE)
# Train/test split
train <- house_prices_shuffled %>%
slice(___:___)
test <- house_prices_shuffled %>%
slice(___:___)