Train और Test में विभाजन
अब जब हमारे पास एक dataframe है, तो हम मॉडलिंग के लिए standard तकनीकें लागू कर सकते हैं. इस अभ्यास में, आप डेटा को training और test सेट में विभाजित करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में नेटवर्क्ड डेटा का उपयोग करके Predictive Analytics
अभ्यास निर्देश
- अपने परिणामों की reproducibility सुनिश्चित करने के लिए,
set.seed()का उपयोग करते हुए seed को 7 पर सेट करें. sample()फंक्शन का उपयोग करकेstudentnetworkdataमें कुल पंक्तियों की रेंज से बनने वाली sequence में से दो-तिहाई नंबर sample करें. इस वेक्टर का नामindex_trainरखें.- training सेट बनाएँ:
studentnetworkdataकी वे पंक्तियाँ शामिल करें जोindex_trainमें संग्रहीत हैं, और इसेtraining_setनाम दें. - test सेट बनाएँ:
studentnetworkdataकी वे पंक्तियाँ बाहर रखें जोindex_trainमें संग्रहीत हैं, और इसेtest_setनाम दें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]