शुरू करेंमुफ़्त में शुरू करें

SMS स्पैम पाइपलाइन

आपने काफ़ी समय से SMS डेटा नहीं देखा है. पिछली बार हमने ये किया था:

  • टेक्स्ट को टोकन में बाँटा
  • स्टॉप वर्ड्स हटाए
  • हैशिंग ट्रिक लगाई
  • काउंट्स से डेटा को IDF में बदला और
  • एक लॉजिस्टिक रिग्रेशन मॉडल ट्रेन किया.

इनमें से हर स्टेप अलग-अलग किया गया था. यह पाइपलाइन के लिए एक बेहतरीन उपयोग लगता है!

Pipeline और LogisticRegression क्लासेज़ पहले से सेशन में इम्पोर्ट हैं, इसलिए इसकी चिंता न करें!

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • टेक्स्ट को टोकन में बाँटने के लिए एक ऑब्जेक्ट बनाएँ.
  • स्टॉप वर्ड्स हटाने के लिए एक ऑब्जेक्ट बनाएँ. इनपुट कॉलम का नाम सीधे देने के बजाय, पिछले ऑब्जेक्ट पर getOutputCol() मेथड का उपयोग करें.
  • हैशिंग ट्रिक लगाने और डेटा को TF-IDF में बदलने के लिए ऑब्जेक्ट्स बनाएँ. यहाँ भी getOutputCol() मेथड का उपयोग करें.
  • ऊपर के सभी स्टेप्स के साथ-साथ Logistic Regression मॉडल बनाने वाले ऑब्जेक्ट को शामिल करते हुए एक पाइपलाइन बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from pyspark.ml.feature import Tokenizer, StopWordsRemover, HashingTF, IDF

# Break text into tokens at non-word characters
tokenizer = ____(inputCol='text', outputCol='words')

# Remove stop words
remover = ____(inputCol=____, outputCol='terms')

# Apply the hashing trick and transform to TF-IDF
hasher = ____(inputCol=____, outputCol="hash")
idf = ____(inputCol=____, outputCol="features")

# Create a logistic regression object and add everything to a pipeline
logistic = LogisticRegression()
pipeline = Pipeline(stages=[____, ____, ____, ____, logistic])
कोड संपादित करें और चलाएँ