Přidávání komponent do pipeline v spaCy
Pro různé NLP úlohy se běžně používají hotové modely spaCy. V některých případech ale může předdefinovaná komponenta pipeline, jako je třeba segmentace vět, trvat zbytečně dlouho. V tomto cvičení si procvičíš přidávání komponenty pipeline do modelu spaCy (pipeline pro zpracování textu).
Použiješ prvních pět recenzí z datové sady Amazon Fine Food Reviews. K těmto recenzím se dostaneš přes řetězec texts.
Balíček spaCy je již naimportován a připravený k použití.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Načti prázdný anglický model
spaCya přidej do něj komponentusentencizer. - Vytvoř kontejner
Docprotexts, vytvoř seznam pro uloženísentencesdaného dokumentu a vypiš počet vět. - Vypiš seznam tokenů z druhé věty ze seznamu
sentences.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])