Začněte nyníZačněte zdarma

Spuštění pipeline v spaCy

Už jsi spustil/a NLP pipeline spaCy na jednom textu a extrahoval/a tokeny z daného seznamu kontejnerů Doc. V tomto cvičení si procvičíš základní kroky spuštění pipeline spaCy na proměnné texts, což je seznam textových řetězců.

K tomu použiješ model en_core_web_sm. Balíček spaCy je už naimportovaný.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Načti model en_core_web_sm jako nlp.
  • Spusť model nlp() na každé položce ze texts a každý výsledný kontejner Doc přidej do seznamu documents.
  • Vypiš texty tokenů pro každý kontejner Doc ze seznamu documents.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load en_core_web_sm model as nlp
nlp = spacy.____(____)

# Run an nlp model on each item of texts and append the Doc container to documents
documents = []
for text in ____:
  documents.append(____)
  
# Print the token texts for each Doc container
for doc in documents:
  print([____ for ____ in ____])
Upravit a spustit kód