शुरू करेंमुफ़्त में शुरू करें

Cross-validation data frames

अब जब आपने अपने डेटा का एक हिस्सा testing data के रूप में अलग रख दिया है, तो आप बचे हुए हिस्से का उपयोग सबसे अच्छा प्रदर्शन करने वाला मॉडल ढूँढने के लिए कर सकते हैं.

इस अभ्यास में, आप rsample पैकेज के vfold_cv() फंक्शन का उपयोग करके प्रशिक्षण डेटा को 5 train-validate सेट्स में बाँटेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Tidyverse में मशीन लर्निंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • training_data से vfold_cv() का उपयोग करके 5-fold cross validation के लिए एक data frame बनाएँ और उसे cv_split में असाइन करें.
  • cv_data तैयार करें, जिसके लिए cv_split में दो नए कॉलम जोड़ें:
    • train: जिसमें splits कॉलम पर training() map करके निकाले गए train data frames हों.
    • validate: जिसमें splits कॉलम पर testing() map करके निकाले गए validate data frames हों.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
कोड संपादित करें और चलाएँ