शुरू करेंमुफ़्त में शुरू करें

टेस्ट-ट्रेन स्प्लिट

एक सुव्यवस्थित मशीन लर्निंग वर्कफ़्लो में, आपके डेटा का एक हिस्सा (testing data) निर्णय लेने की किसी भी प्रक्रिया से अलग रखना ज़रूरी होता है। इससे आप अपने फ़ाइनल मॉडल का प्रदर्शन स्वतंत्र रूप से जाँच सकते हैं। शेष डेटा, यानी training data, का उपयोग मॉडल बनाने और सबसे अच्छा मॉडल चुनने के लिए किया जाता है.

इस अभ्यास में, आप rsample पैकेज का उपयोग करके अपने gapminder डेटा का शुरुआती train-test स्प्लिट करेंगे.

नोट: क्योंकि यह डेटा का random स्प्लिट है, स्प्लिट करने से पहले seed सेट करना अच्छी प्रैक्टिस है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Tidyverse में मशीन लर्निंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • अपने डेटा को initial_split() फ़ंक्शन का उपयोग करते हुए 75% training और 25% testing में बाँटें और उसे gap_split में असाइन करें.
  • training() फ़ंक्शन का उपयोग करके gap_split से training डेटा फ़्रेम निकालें.
  • testing() फ़ंक्शन का उपयोग करके gap_split से testing डेटा फ़्रेम निकालें.
  • training_data और testing_data पर dim() फ़ंक्शन चलाकर जाँचें कि नए डेटा फ़्रेम के आयाम आपकी अपेक्षा के अनुरूप हैं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

set.seed(42)

# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)

# Extract the training data frame
training_data <- ___

# Extract the testing data frame
testing_data <- ___

# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)
कोड संपादित करें और चलाएँ