Začněte nyníZačněte zdarma

Přidávání komponent do pipeline v spaCy

Pro různé NLP úlohy se běžně používají hotové modely spaCy. V některých případech ale může předdefinovaná komponenta pipeline, jako je třeba segmentace vět, trvat zbytečně dlouho. V tomto cvičení si procvičíš přidávání komponenty pipeline do modelu spaCy (pipeline pro zpracování textu).

Použiješ prvních pět recenzí z datové sady Amazon Fine Food Reviews. K těmto recenzím se dostaneš přes řetězec texts.

Balíček spaCy je již naimportován a připravený k použití.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Načti prázdný anglický model spaCy a přidej do něj komponentu sentencizer.
  • Vytvoř kontejner Doc pro texts, vytvoř seznam pro uložení sentences daného dokumentu a vypiš počet vět.
  • Vypiš seznam tokenů z druhé věty ze seznamu sentences.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Upravit a spustit kód