교차 검증 데이터 프레임
테스트 데이터로 일부 데이터를 따로 보관해 두었으니, 이제 나머지 데이터를 활용해 가장 성능이 좋은 모델을 찾을 수 있습니다.
이번 연습 문제에서는 rsample 패키지의 vfold_cv() 함수를 사용하여 훈련 데이터를 5개의 train-validate 세트로 분할해 보겠습니다.
이 연습은 강의의 일부입니다
Tidyverse로 배우는 Machine Learning
연습 안내
vfold_cv()를 사용하여training_data에서 5-겹 교차 검증용 데이터 프레임을 만들고cv_split에 할당하세요.cv_split에 새로운 열 두 개를 추가하여cv_data를 준비하세요:train:splits열에training()을 매핑하여 얻은 train 데이터 프레임을 담습니다.validate:splits열에testing()을 매핑하여 얻은 validate 데이터 프레임을 담습니다.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)