spaCy के साथ Lemmatization
इस अभ्यास में, आप lemmatization का अभ्यास करेंगे. Lemmatization से व्युत्पन्न शब्दों के मूल रूप निकालने में मदद मिलती है. इसका अर्थ है कि किसी भी वाक्य के लिए, lemmas की संख्या टोकनों की संख्या से कम या बराबर होनी चाहिए.
पहला Amazon फूड रिव्यू आपके लिए text नाम की एक string में दिया गया है. en_core_web_sm को nlp के रूप में लोड किया गया है, और text पर चलाकर document कंपाइल किया गया है, जो इस टेक्स्ट string के लिए एक Doc कंटेनर है.
tokens, जो text के टोकनों की एक लिस्ट है, आपके उपयोग के लिए पहले से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
documentके सभी टोकनों के लिए लेमा जोड़ें, फिरlemmasलिस्ट को प्रिंट करें.tokensलिस्ट प्रिंट करें औरtokensतथाlemmasके बीच के अंतर देखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)