Bắt đầu ngayBắt đầu miễn phí

Các data frame cho cross-validation

Bây giờ bạn đã giữ lại một phần dữ liệu làm testing data, bạn có thể dùng phần còn lại để tìm mô hình hoạt động tốt nhất.

Trong bài này, bạn sẽ chia training data thành một loạt 5 bộ train-validate bằng hàm vfold_cv() từ gói rsample.

Bài tập này là một phần của khóa học

Machine Learning trong tidyverse

Xem khóa học

Hướng dẫn bài tập

  • Tạo một data frame cho cross validation 5-fold từ training_data bằng vfold_cv() và gán vào cv_split.
  • Chuẩn bị cv_data bằng cách thêm hai cột mới vào cv_split:
    • train: chứa các data frame train bằng cách ánh xạ training() qua cột splits.
    • validate: chứa các data frame validate bằng cách ánh xạ testing() qua cột splits.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Chỉnh sửa và Chạy Mã