शुरू करेंमुफ़्त में शुरू करें

क्रॉस वेलिडेशन

अगले कुछ अभ्यासों में आप अपने लॉजिस्टिक रिग्रेशन मॉडल को k-fold क्रॉस वेलिडेशन नाम की प्रक्रिया से ट्यून करेंगे. यह अनदेखे डेटा (जैसे आपका test DataFrame) पर मॉडल के प्रदर्शन का अनुमान लगाने का तरीका है.

यह प्रशिक्षण डेटा को कुछ अलग-अलग पार्टिशनों में बाँटकर काम करता है. सटीक संख्या आपके ऊपर है, लेकिन इस कोर्स में आप PySpark का डिफ़ॉल्ट मान तीन इस्तेमाल करेंगे. डेटा बाँटने के बाद, एक पार्टिशन को अलग रखा जाता है और मॉडल को बाकी पार्टिशनों पर फिट किया जाता है. फिर त्रुटि को उस held out पार्टिशन पर मापा जाता है. यह प्रत्येक पार्टिशन के लिए दोहराया जाता है ताकि हर ब्लॉक को एक बार ठीक उसी तरह अलग रखकर test सेट की तरह उपयोग किया जा सके. इसके बाद हर पार्टिशन पर मिली त्रुटि का औसत लिया जाता है. इसे मॉडल की क्रॉस वेलिडेशन त्रुटि कहते हैं, और यह अलग रखे गए डेटा पर वास्तविक त्रुटि का अच्छा अनुमान होता है.

आप क्रॉस वेलिडेशन का उपयोग हाइपरपैरामीटर्स चुनने के लिए करेंगे: elasticNetParam और regParam दोनो के संभावित मानों के जोड़ों की एक ग्रिड बनाएँगे, और अलग-अलग मॉडलों की तुलना करने के लिए क्रॉस वेलिडेशन त्रुटि का उपयोग करेंगे ताकि आप सबसे बेहतर मॉडल चुन सकें!

क्रॉस वेलिडेशन आपको किस चीज़ का अनुमान लगाने देता है?

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें