spaCy के साथ Sentence segmentation
इस अभ्यास में, आप sentence segmentation का अभ्यास करेंगे। NLP में, किसी डॉक्यूमेंट को उसके वाक्यों में बाँटना एक उपयोगी बुनियादी ऑपरेशन है। यह कई उन्नत NLP टास्क्स (जैसे named entities पहचानना) के शुरुआती चरणों में से एक है। साथ ही, वाक्यों की संख्या कैप्चर करने से इस बात की समझ मिल सकती है कि टेक्स्ट में जानकारी कितनी दी गई है।
आपके पास texts नाम की सूची में दस फूड रिव्यूज़ उपलब्ध हैं।
en_core_web_sm मॉडल पहले से nlp के रूप में लोड किया गया है और तैयार है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
textsसूची के प्रत्येक आइटम परspaCyमॉडल चलाकरdocumentsनाम की सूची बनाएँ, जिसमें सभीDocकंटेनर हों।documentsसूची पर iterate करके प्रत्येकdocकंटेनर की sentences निकालें और उन्हेंsentencesनाम की सूची में append करें।sentencesसूची का उपयोग करके प्रत्येकdocकंटेनर में वाक्यों की संख्या गिनें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])