Segmentacja zdań w spaCy
W tym ćwiczeniu przećwiczysz segmentację zdań. W NLP podział dokumentu na zdania to przydatna operacja bazowa – jeden z pierwszych kroków w wielu bardziej złożonych zadaniach, takich jak wykrywanie nazwanych encji. Ponadto zliczenie zdań może dać pewien wgląd w ilość informacji zawartych w tekście.
Masz dostęp do dziesięciu recenzji jedzenia w liście o nazwie texts.
Model en_core_web_sm został już wczytany jako nlp i .
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Uruchom model
spaCyna każdym elemencie listytexts, aby zbudowaćdocuments– listę wszystkich kontenerówDoc. - Wyodrębnij zdania z każdego kontenera
doc, iterując po liściedocuments, i dodaj je do listy o nazwiesentences. - Policz liczbę zdań w każdym kontenerze
doc, korzystając z listysentences.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])