Train/test split
किसी Machine Learning मॉडल का वस्तुनिष्ठ मूल्यांकन करने के लिए, आपको उसे एक स्वतंत्र डेटा सेट पर टेस्ट करना होता है। जिस डेटा पर आपने मॉडल ट्रेन किया है, उसी डेटा का उपयोग नहीं कर सकते: उस पर तो मॉडल (तुलनात्मक रूप से) अच्छा ही प्रदर्शन करेगा!
आप डेटा को दो हिस्सों में बाँटेंगे:
- training डेटा (मॉडल को ट्रेन करने के लिए) और
- testing डेटा (मॉडल को टेस्ट करने के लिए).
नोट: अब से आप flights डेटा के एक छोटे सबसेट के साथ काम करेंगे, ताकि अभ्यास तेजी से चलें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
flightsडेटा को 80:20 अनुपात में यादृच्छिक रूप से दो सेट में बाँटें। दोहराए जाने योग्य परिणामों के लिए split में random number seed 43 सेट करें.- जाँचें कि training डेटा में मूल डेटा के लगभग 80% रिकॉर्ड्स हैं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)