Kontejner Doc v spaCy
Prvním krokem zpracovatelského pipeline v spaCy je převod textového řetězce na kontejner Doc, který uchovává zpracovaný text. V tomto cvičení si procvičíš načtení modelu spaCy, vytvoření objektu nlp(), vytvoření kontejneru Doc a zpracování řetězce text, který máš k dispozici.
Model en_core_web_sm je již stažený.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Načti model
en_core_web_sma vytvoř objektnlp. - Vytvoř kontejner
docz řetězcetext. - Vytvoř seznam obsahující text každého tokenu v kontejneru
doc.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load en_core_web_sm and create an nlp object
nlp = spacy.____(____)
# Create a Doc container for the text object
doc = ____(____)
# Create a list containing the text of each token in the Doc container
print([____ for ____ in ____])