शुरू करेंमुफ़्त में शुरू करें

spaCy के साथ Sentence segmentation

इस अभ्यास में, आप sentence segmentation का अभ्यास करेंगे। NLP में, किसी डॉक्यूमेंट को उसके वाक्यों में बाँटना एक उपयोगी बुनियादी ऑपरेशन है। यह कई उन्नत NLP टास्क्स (जैसे named entities पहचानना) के शुरुआती चरणों में से एक है। साथ ही, वाक्यों की संख्या कैप्चर करने से इस बात की समझ मिल सकती है कि टेक्स्ट में जानकारी कितनी दी गई है।

आपके पास texts नाम की सूची में दस फूड रिव्यूज़ उपलब्ध हैं।

en_core_web_sm मॉडल पहले से nlp के रूप में लोड किया गया है और तैयार है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

spaCy के साथ Natural Language Processing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • texts सूची के प्रत्येक आइटम पर spaCy मॉडल चलाकर documents नाम की सूची बनाएँ, जिसमें सभी Doc कंटेनर हों।
  • documents सूची पर iterate करके प्रत्येक doc कंटेनर की sentences निकालें और उन्हें sentences नाम की सूची में append करें।
  • sentences सूची का उपयोग करके प्रत्येक doc कंटेनर में वाक्यों की संख्या गिनें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
कोड संपादित करें और चलाएँ