शुरू करेंमुफ़्त में शुरू करें

एक ब्लॉग पोस्ट को साफ करना

इस अभ्यास में, आपको एक ब्लॉग पोस्ट का एक अंश दिया गया है. आपका काम इस टेक्स्ट को ऐसे रूप में साफ करना है जो मशीनों के लिए ज्यादा अनुकूल हो. इसमें टेक्स्ट को लोअरकेस में बदलना, lemmatization करना, और stopwords, punctuations तथा गैर-वर्णमालात्मक कैरेक्टर्स को हटाना शामिल है.

यह अंश blog नाम की string के रूप में उपलब्ध है और कंसोल पर प्रिंट किया गया है. stopwords की सूची stopwords के रूप में उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में NLP के लिए Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • List comprehension का उपयोग करते हुए, doc पर लूप चलाएँ और हर token का lemma_ निकालें.
  • stopwords और isalpha() का उपयोग करके stopwords और गैर-वर्णमालात्मक tokens हटाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
कोड संपादित करें और चलाएँ