शुरू करेंमुफ़्त में शुरू करें

स्पैम क्लासिफायर को ट्रेन करना

SMS डेटा अब एक क्लासिफायर बनाने के लिए तैयार है. विशेष रूप से, आपने यह किया है:

  • नंबर और punctuation हटाए
  • संदेशों को शब्दों (या "tokens") में बाँटा
  • stop words हटाए
  • hashing trick लागू की और
  • TF-IDF representation में बदला.

अब आपको TF-IDF डेटा को training और testing सेट में बाँटने की जरूरत होगी. फिर आप training डेटा से Logistic Regression मॉडल fit करेंगे और अंत में testing डेटा पर उस मॉडल के performance का मूल्यांकन करेंगे.

डेटा sms में स्टोर है और LogisticRegression आपके लिए import किया जा चुका है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • डेटा को 4:1 अनुपात में training और testing सेट में बाँटें. दोहराव सुनिश्चित करने के लिए random number seed को 13 सेट करें.
  • एक LogisticRegression ऑब्जेक्ट बनाइए और उसे training डेटा पर fit कीजिए.
  • testing डेटा पर predictions जनरेट कीजिए.
  • predictions का उपयोग करके confusion matrix तैयार कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Split the data into training and testing sets
sms_train, sms_test = sms.____(____, ____)

# Fit a Logistic Regression model to the training data
logistic = ____(regParam=0.2).____(____)

# Make predictions on the testing data
prediction = logistic.____(____)

# Create a confusion matrix, comparing predictions to known labels
prediction.groupBy(____, ____).____().____()
कोड संपादित करें और चलाएँ