Przetwarzanie tekstu za pomocą spaCy
Każda aplikacja NLP składa się z kilku kroków przetwarzania tekstu. Poznałeś już niektóre z nich – tokenizację, lematyzację, segmentację zdań oraz rozpoznawanie nazwanych jednostek.
W tym ćwiczeniu będziesz dalej ćwiczyć kroki przetwarzania tekstu w spaCy – m.in. podział tekstu na zdania i wyodrębnianie nazwanych jednostek. Skorzystasz z pięciu pierwszych recenzji z zestawu danych Amazon Fine Food Reviews. Możesz uzyskać do nich dostęp za pomocą obiektu texts.
Model en_core_web_sm jest już wczytany i dostępny jako nlp. Lista kontenerów Doc dla każdego elementu ze zbioru texts jest również gotowa do użycia pod nazwą documents.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)