Zacznij terazZacznij za darmo

Segmentacja zdań w spaCy

W tym ćwiczeniu przećwiczysz segmentację zdań. W NLP podział dokumentu na zdania to przydatna operacja bazowa – jeden z pierwszych kroków w wielu bardziej złożonych zadaniach, takich jak wykrywanie nazwanych encji. Ponadto zliczenie zdań może dać pewien wgląd w ilość informacji zawartych w tekście.

Masz dostęp do dziesięciu recenzji jedzenia w liście o nazwie texts.

Model en_core_web_sm został już wczytany jako nlp i .

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Uruchom model spaCy na każdym elemencie listy texts, aby zbudować documents – listę wszystkich kontenerów Doc.
  • Wyodrębnij zdania z każdego kontenera doc, iterując po liście documents, i dodaj je do listy o nazwie sentences.
  • Policz liczbę zdań w każdym kontenerze doc, korzystając z listy sentences.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
Edytuj i uruchom kod