Kom igångKom igång gratis

Lägga till komponenter i spaCy

Du använder ofta en befintlig spaCy-modell för olika NLP-uppgifter. I vissa fall kan dock en färdig pipeline-komponent som meningssegmentering ta lång tid att producera förväntade resultat. I den här övningen får du öva på att lägga till en pipeline-komponent i en spaCy-modell (en pipeline för textbearbetning).

Du kommer att använda de fem första recensionerna från datamängden Amazon Fine Food Reviews. Du kan komma åt dessa recensioner via strängen texts.

Paketet spaCy är redan importerat och klart att använda.

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Läs in en tom spaCy-modell för engelska och lägg till en sentencizer-komponent i modellen.
  • Skapa en Doc-behållare för texts, skapa en lista för att lagra sentences från det givna dokumentet och skriv ut antalet meningar.
  • Skriv ut listan med tokens i den andra meningen från listan sentences.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Redigera och kör kod