Kom igångKom igång gratis

Meningssegmentering med spaCy

I den här övningen får du öva på meningssegmentering. Inom NLP är det en grundläggande och användbar operation att dela upp ett dokument i enskilda meningar. Det är ett av de första stegen i många mer avancerade NLP-uppgifter, till exempel igenkänning av namngivna entiteter. Dessutom kan antalet meningar ge en indikation om hur mycket information texten innehåller.

Du har tillgång till tio matrecensioner i listan texts.

Modellen en_core_web_sm har redan laddats åt dig som nlp och .

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Kör spaCy-modellen på varje element i listan texts för att skapa documents, en lista med alla Doc-behållare.
  • Extrahera meningarna från varje doc-behållare genom att iterera igenom listan documents och lägg till dem i en lista kallad sentences.
  • Räkna antalet meningar i varje doc-behållare med hjälp av listan sentences.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
Redigera och kör kod