Training और Test डेटासेट बनाना
किसी डेटासेट को training और test सेट में बाँटना, एक क्लासिफिकेशन मॉडल को बनाते और परखते समय एक अहम कदम होता है. Training सेट से मॉडल बनाया जाता है और test सेट से उसकी predictive accuracy आंकी जाती है.
इस अभ्यास में, आप पिछले चैप्टर में बनाए गए डेटासेट को training और test सेट में बाँटेंगे. यह डेटासेट डेटा फ़्रेम df में लोड कर दिया गया है और reproducibility सुनिश्चित करने के लिए seed पहले से सेट है. पिछले वीडियो में याद कीजिए, हमने training सेट की लंबाई के लिए upper bound कुछ उपयोगी फंक्शंस से तय किया था — अब इन्हें लागू करने की बारी आपकी है!
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Support Vector Machines
अभ्यास निर्देश
- Training सेट में जाने वाली पंक्तियों (rows) की अधिकतम सीमा निकालें और उसे
sample_sizeमें स्टोर करें. - 80/20 अनुपात के अनुसार रैंडमली चुना गया training सेट स्टोर करने के लिए वेक्टर
trainबनाएँ. trainवेक्टर में बताई गई पंक्तियों को डेटा फ़्रेमtrainsetमें असाइन करें और बाकी पंक्तियों को डेटा फ़्रेमtestsetमें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]