Cross-validation data frames
अब जब आपने अपने डेटा का एक हिस्सा testing data के रूप में अलग रख दिया है, तो आप बचे हुए हिस्से का उपयोग सबसे अच्छा प्रदर्शन करने वाला मॉडल ढूँढने के लिए कर सकते हैं.
इस अभ्यास में, आप rsample पैकेज के vfold_cv() फंक्शन का उपयोग करके प्रशिक्षण डेटा को 5 train-validate सेट्स में बाँटेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Tidyverse में मशीन लर्निंग
अभ्यास निर्देश
training_dataसेvfold_cv()का उपयोग करके 5-fold cross validation के लिए एक data frame बनाएँ और उसेcv_splitमें असाइन करें.cv_dataतैयार करें, जिसके लिएcv_splitमें दो नए कॉलम जोड़ें:train: जिसमेंsplitsकॉलम परtraining()map करके निकाले गए train data frames हों.validate: जिसमेंsplitsकॉलम परtesting()map करके निकाले गए validate data frames हों.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)