Meningssegmentering med spaCy
I den här övningen får du öva på meningssegmentering. Inom NLP är det en grundläggande och användbar operation att dela upp ett dokument i enskilda meningar. Det är ett av de första stegen i många mer avancerade NLP-uppgifter, till exempel igenkänning av namngivna entiteter. Dessutom kan antalet meningar ge en indikation om hur mycket information texten innehåller.
Du har tillgång till tio matrecensioner i listan texts.
Modellen en_core_web_sm har redan laddats åt dig som nlp och .
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Kör
spaCy-modellen på varje element i listantextsför att skapadocuments, en lista med allaDoc-behållare. - Extrahera meningarna från varje
doc-behållare genom att iterera igenom listandocumentsoch lägg till dem i en lista kalladsentences. - Räkna antalet meningar i varje
doc-behållare med hjälp av listansentences.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])