Các data frame cho cross-validation
Bây giờ bạn đã giữ lại một phần dữ liệu làm testing data, bạn có thể dùng phần còn lại để tìm mô hình hoạt động tốt nhất.
Trong bài này, bạn sẽ chia training data thành một loạt 5 bộ train-validate bằng hàm vfold_cv() từ gói rsample.
Bài tập này là một phần của khóa học
Machine Learning trong tidyverse
Hướng dẫn bài tập
- Tạo một data frame cho cross validation 5-fold từ
training_databằngvfold_cv()và gán vàocv_split. - Chuẩn bị
cv_databằng cách thêm hai cột mới vàocv_split:train: chứa các data frame train bằng cách ánh xạtraining()qua cộtsplits.validate: chứa các data frame validate bằng cách ánh xạtesting()qua cộtsplits.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)