spaCy में पाइप्स जोड़ना
आप अलग-अलग NLP टास्क के लिए अक्सर मौजूदा spaCy मॉडल का उपयोग करते हैं. लेकिन कई बार ऑफ-द-शेल्फ पाइपलाइन कंपोनेंट, जैसे sentence segmentation, अपेक्षित परिणाम देने में ज्यादा समय ले सकता है. इस अभ्यास में, आप spaCy मॉडल (टेक्स्ट प्रोसेसिंग पाइपलाइन) में एक पाइपलाइन कंपोनेंट जोड़ने का अभ्यास करेंगे.
इस अभ्यास के लिए आप Amazon Fine Food Reviews डेटासेट की पहली पाँच समीक्षाएँ उपयोग करेंगे. इन समीक्षाओं तक आप texts स्ट्रिंग द्वारा पहुँच सकते हैं.
spaCy पैकेज पहले से इम्पोर्ट किया गया है, आप सीधे उपयोग कर सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
- एक खाली
spaCyEnglish मॉडल लोड करें और मॉडल मेंsentencizerकंपोनेंट जोड़ें. textsके लिए एकDocकंटेनर बनाएँ, दिए गए डॉक्युमेंट केsentencesको स्टोर करने के लिए एक लिस्ट बनाएँ, और वाक्यों की संख्या प्रिंट करें.sentencesलिस्ट के दूसरे वाक्य के टोकन्स की लिस्ट प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])