टेस्ट बनाम ट्रेन
डेटा को क्लीन करके मॉडलिंग के लिए तैयार करने के बाद, सबसे महत्वपूर्ण चरणों में से एक है डेटा को एक टेस्ट सेट और एक ट्रेन सेट में बाँटना। इसके बाद, जब तक आपको न लगे कि आपके पास एक अच्छा मॉडल है, तब तक अपने टेस्ट डेटा को न छुएँ! जब आप मॉडल बनाते हैं और परिकल्पनाएँ बनाते हैं, तो आप उनके प्रदर्शन का अंदाज़ा लगाने के लिए उन्हें अपने ट्रेनिंग डेटा पर जाँच सकते हैं।
जब आप अपना पसंदीदा मॉडल चुन लें, तो आप देख सकते हैं कि वह आपके टेस्ट सेट के नए डेटा पर कितना अच्छा प्रेडिक्ट करता है। यह पहले कभी न देखा गया डेटा आपको वास्तविक दुनिया में नए डेटा को प्रेडिक्ट या क्लासिफ़ाई करते समय मॉडल के प्रदर्शन की कहीं अधिक वास्तविक तस्वीर देगा।
Spark में यह ज़रूरी है कि आप सभी ट्रांसफ़ॉर्मेशंस के बाद डेटा को स्प्लिट करें। ऐसा इसलिए क्योंकि StringIndexer जैसी ऑपरेशंस, एक ही स्ट्रिंग लिस्ट दिए जाने पर भी, हमेशा वही इंडेक्स नहीं बनातीं।
मॉडल इवैल्यूएशन में टेस्ट सेट का उपयोग करना क्यों महत्वपूर्ण है?
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें