रैंडम test/train स्प्लिट बनाना
अगले कुछ अभ्यासों के लिए आप पैकेज ggplot2 के mpg डेटा का उपयोग करेंगे। यह डेटा अलग-अलग सालों के कई कार निर्माताओं और मॉडलों की विशेषताओं का विवरण देता है। लक्ष्य है: highway फ्यूल एफिशिएंसी से city फ्यूल एफिशिएंसी को प्रेडिक्ट करना।
इस अभ्यास में, आप mpg को एक प्रशिक्षण सेट mpg_train (डेटा का 75%) और एक टेस्ट सेट mpg_test (डेटा का 25%) में बाँटेंगे। इसका एक तरीका है 0 और 1 के बीच यूनिफॉर्म रैंडम नंबरों का एक कॉलम जनरेट करना, फंक्शन runif() (docs) का उपयोग करके।
यदि आपके पास आकार \(N\) का कोई डेटासेट dframe है, और आप \(N\) का लगभग \(100 * X\)% (जहाँ \(X\) 0 और 1 के बीच है) का एक रैंडम सबसेट चाहते हैं, तो:
- यूनिफॉर्म रैंडम नंबरों का एक वेक्टर जनरेट करें:
gp = runif(N). dframe[gp < X,]लगभग सही आकार का होगा।dframe[gp >= X,]उसका कॉम्प्लिमेंट होगा।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Supervised Learning: Regression
अभ्यास निर्देश
- डेटा फ्रेम
mpgमें पंक्तियों की संख्या पाने के लिएnrow(docs) फंक्शन का उपयोग करें। इस काउंट को वैरिएबलNमें असाइन करें और प्रिंट करें। - अनुमान लगाएँ कि N का 75% लगभग कितनी पंक्तियाँ होंगी। इसे वैरिएबल
targetमें असाइन करें और प्रिंट करें। runif()का उपयोग करकेNयूनिफॉर्म रैंडम नंबरों का एक वेक्टर जनरेट करें, जिसका नामgpरखें।gpका उपयोग करकेmpgकोmpg_trainऔरmpg_testमें बाँटें (जहाँmpg_trainमें लगभग 75% डेटा हो)।nrow()का उपयोग करकेmpg_trainऔरmpg_testके आकार जाँचें। क्या वे लगभग सही आकार के हैं?
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# mpg is available
summary(mpg)
dim(mpg)
# Use nrow to get the number of rows in mpg (N) and print it
(N <- ___)
# Calculate how many rows 75% of N should be and print it
# Hint: use round() to get an integer
(target <- ___)
# Create the vector of N uniform random variables: gp
gp <- ___
# Use gp to create the training set: mpg_train (75% of data) and mpg_test (25% of data)
mpg_train <- ___
mpg_test <- ___
# Use nrow() to examine mpg_train and mpg_test
___
___