Spuštění pipeline v spaCy
Už jsi spustil/a NLP pipeline spaCy na jednom textu a extrahoval/a tokeny z daného seznamu kontejnerů Doc. V tomto cvičení si procvičíš základní kroky spuštění pipeline spaCy na proměnné texts, což je seznam textových řetězců.
K tomu použiješ model en_core_web_sm. Balíček spaCy je už naimportovaný.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Načti model
en_core_web_smjakonlp. - Spusť model
nlp()na každé položce zetextsa každý výsledný kontejnerDocpřidej do seznamudocuments. - Vypiš texty tokenů pro každý kontejner
Docze seznamudocuments.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load en_core_web_sm model as nlp
nlp = spacy.____(____)
# Run an nlp model on each item of texts and append the Doc container to documents
documents = []
for text in ____:
documents.append(____)
# Print the token texts for each Doc container
for doc in documents:
print([____ for ____ in ____])