Lägga till komponenter i spaCy
Du använder ofta en befintlig spaCy-modell för olika NLP-uppgifter. I vissa fall kan dock en färdig pipeline-komponent som meningssegmentering ta lång tid att producera förväntade resultat. I den här övningen får du öva på att lägga till en pipeline-komponent i en spaCy-modell (en pipeline för textbearbetning).
Du kommer att använda de fem första recensionerna från datamängden Amazon Fine Food Reviews. Du kan komma åt dessa recensioner via strängen texts.
Paketet spaCy är redan importerat och klart att använda.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Läs in en tom
spaCy-modell för engelska och lägg till ensentencizer-komponent i modellen. - Skapa en
Doc-behållare förtexts, skapa en lista för att lagrasentencesfrån det givna dokumentet och skriv ut antalet meningar. - Skriv ut listan med tokens i den andra meningen från listan
sentences.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])