SMS स्पैम ऑप्टिमाइज़्ड
SMS स्पैम मॉडल के लिए आपने जो पाइपलाइन पहले बनाई थी, उसमें पाइपलाइन के सभी एलिमेंट्स के लिए डिफ़ॉल्ट पैरामीटर थे. हालांकि, यह बहुत संभव है कि ये पैरामीटर कोई खास अच्छा मॉडल न दें. इस अभ्यास में आप कुछ चुने हुए पैरामीटर मानों के साथ पाइपलाइन चलाएँगे. हम यह काम व्यवस्थित तरीके से करेंगे: हर हाइपरपैरामीटर के मानों को एक ग्रिड पर रखा जाएगा और फिर पाइपलाइन उस ग्रिड के हर पॉइंट पर व्यवस्थित रूप से चलेगी.
इस अभ्यास में आप एक पैरामीटर ग्रिड सेटअप करेंगे जिसे क्रॉस-वैलिडेशन के साथ इस्तेमाल करके SMS स्पैम क्लासिफायर के लिए अच्छे पैरामीटर चुने जा सकें.
निम्नलिखित पहले से परिभाषित हैं:
hasher— एकHashingTFऑब्जेक्ट औरlogistic— एकLogisticRegressionऑब्जेक्ट.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- एक पैरामीटर ग्रिड बिल्डर ऑब्जेक्ट बनाएँ.
HashingTFऑब्जेक्ट केnumFeaturesऔरbinaryपैरामीटर के लिए ग्रिड पॉइंट जोड़ें, जिनके मान क्रमशः 1024, 4096 और 16384, तथा True और False हों.LogisticRegressionऑब्जेक्ट केregParamऔरelasticNetParamपैरामीटर के लिए ग्रिड पॉइंट जोड़ें, जिनके मान क्रमशः 0.01, 0.1, 1.0 और 10.0, तथा 0.0, 0.5, और 1.0 हों.- पैरामीटर ग्रिड बिल्ड करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()