Dodawanie komponentów do potoku w spaCy
Do różnych zadań NLP często korzysta się z gotowych modeli spaCy. Jednak w niektórych przypadkach standardowy komponent potoku, taki jak segmentacja zdań, może działać zbyt wolno. W tym ćwiczeniu przećwiczysz dodawanie komponentu do modelu spaCy (potoku przetwarzania tekstu).
W ćwiczeniu wykorzystasz pięć pierwszych recenzji z zbioru danych Amazon Fine Food Reviews. Dostęp do tych recenzji uzyskasz za pomocą zmiennej texts.
Pakiet spaCy jest już zaimportowany i gotowy do użycia.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Wczytaj pusty angielski model
spaCyi dodaj do niego komponentsentencizer. - Utwórz kontener
Docdla zmiennejtexts, stwórz listę przechowującąsentencesdanego dokumentu i wyświetl liczbę zdań. - Wyświetl listę tokenów z drugiego zdania z listy
sentences.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])