शुरू करेंमुफ़्त में शुरू करें

SMS स्पैम ऑप्टिमाइज़्ड

SMS स्पैम मॉडल के लिए आपने जो पाइपलाइन पहले बनाई थी, उसमें पाइपलाइन के सभी एलिमेंट्स के लिए डिफ़ॉल्ट पैरामीटर थे. हालांकि, यह बहुत संभव है कि ये पैरामीटर कोई खास अच्छा मॉडल न दें. इस अभ्यास में आप कुछ चुने हुए पैरामीटर मानों के साथ पाइपलाइन चलाएँगे. हम यह काम व्यवस्थित तरीके से करेंगे: हर हाइपरपैरामीटर के मानों को एक ग्रिड पर रखा जाएगा और फिर पाइपलाइन उस ग्रिड के हर पॉइंट पर व्यवस्थित रूप से चलेगी.

इस अभ्यास में आप एक पैरामीटर ग्रिड सेटअप करेंगे जिसे क्रॉस-वैलिडेशन के साथ इस्तेमाल करके SMS स्पैम क्लासिफायर के लिए अच्छे पैरामीटर चुने जा सकें.

निम्नलिखित पहले से परिभाषित हैं:

  • hasher — एक HashingTF ऑब्जेक्ट और
  • logistic — एक LogisticRegression ऑब्जेक्ट.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक पैरामीटर ग्रिड बिल्डर ऑब्जेक्ट बनाएँ.
  • HashingTF ऑब्जेक्ट के numFeatures और binary पैरामीटर के लिए ग्रिड पॉइंट जोड़ें, जिनके मान क्रमशः 1024, 4096 और 16384, तथा True और False हों.
  • LogisticRegression ऑब्जेक्ट के regParam और elasticNetParam पैरामीटर के लिए ग्रिड पॉइंट जोड़ें, जिनके मान क्रमशः 0.01, 0.1, 1.0 और 10.0, तथा 0.0, 0.5, और 1.0 हों.
  • पैरामीटर ग्रिड बिल्ड करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
कोड संपादित करें और चलाएँ