Zacznij terazZacznij za darmo

Dodawanie komponentów do potoku w spaCy

Do różnych zadań NLP często korzysta się z gotowych modeli spaCy. Jednak w niektórych przypadkach standardowy komponent potoku, taki jak segmentacja zdań, może działać zbyt wolno. W tym ćwiczeniu przećwiczysz dodawanie komponentu do modelu spaCy (potoku przetwarzania tekstu).

W ćwiczeniu wykorzystasz pięć pierwszych recenzji z zbioru danych Amazon Fine Food Reviews. Dostęp do tych recenzji uzyskasz za pomocą zmiennej texts.

Pakiet spaCy jest już zaimportowany i gotowy do użycia.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj pusty angielski model spaCy i dodaj do niego komponent sentencizer.
  • Utwórz kontener Doc dla zmiennej texts, stwórz listę przechowującą sentences danego dokumentu i wyświetl liczbę zdań.
  • Wyświetl listę tokenów z drugiego zdania z listy sentences.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Edytuj i uruchom kod