शुरू करेंमुफ़्त में शुरू करें

स्टॉपवर्ड्स हटाना

आने वाले अभ्यासों में आप Enron ईमेल्स को साफ (clean) करेंगे, ताकि डेटा को टॉपिक मॉडल में इस्तेमाल किया जा सके। टेक्स्ट क्लीनिंग चुनौतीपूर्ण हो सकती है, इसलिए आप इसे सही ढंग से करने के कुछ स्टेप्स सीखेंगे। ईमेल्स वाला डेटाफ़्रेम df उपलब्ध है। पहले स्टेप में आपको उन स्टॉपवर्ड्स और पंक्चुएशन्स की सूची परिभाषित करनी है जिन्हें अगले अभ्यास में टेक्स्ट डेटा से हटाया जाएगा। आइए कोशिश करते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Fraud Detection

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ntlk से stopwords इम्पोर्ट करें.
  • stop वैरिएबल में स्टॉपवर्ड्स के रूप में 'english' शब्दों को परिभाषित करें.
  • string पैकेज से punctuation सेट लें और उसे exclude को असाइन करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
कोड संपादित करें और चलाएँ