Antrenarea modelului pe datele de antrenament
Este momentul să împarți datele într-un set de antrenament, pe care să antrenezi modelul, și un set de testare separat, pentru a evalua puterea predictivă a modelului. Înainte de această împărțire, vom eșantiona 100% din rândurile setului house_prices fără înlocuire și vom atribui rezultatul variabilei house_prices_shuffled. Acest lucru are efectul de a „amesteca" rândurile, asigurând astfel că seturile de antrenament și de testare sunt eșantionate aleatoriu.
Acest exercițiu face parte din cursul
Modelare cu date în Tidyverse
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set random number generator seed value for reproducibility
set.seed(76)
# Randomly reorder the rows
house_prices_shuffled <- house_prices %>%
sample_frac(size = 1, replace = FALSE)
# Train/test split
train <- house_prices_shuffled %>%
slice(___:___)
test <- house_prices_shuffled %>%
slice(___:___)