Zacznij terazZacznij za darmo

Przetwarzanie tekstu za pomocą spaCy

Każda aplikacja NLP składa się z kilku kroków przetwarzania tekstu. Poznałeś już niektóre z nich – tokenizację, lematyzację, segmentację zdań oraz rozpoznawanie nazwanych jednostek.

spaCy NLP Pipeline

W tym ćwiczeniu będziesz dalej ćwiczyć kroki przetwarzania tekstu w spaCy – m.in. podział tekstu na zdania i wyodrębnianie nazwanych jednostek. Skorzystasz z pięciu pierwszych recenzji z zestawu danych Amazon Fine Food Reviews. Możesz uzyskać do nich dostęp za pomocą obiektu texts.

Model en_core_web_sm jest już wczytany i dostępny jako nlp. Lista kontenerów Doc dla każdego elementu ze zbioru texts jest również gotowa do użycia pod nazwą documents.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
Edytuj i uruchom kod