Příprava kroků před trénováním
Před trénováním modelu spaCy a v jeho průběhu je potřeba (1) deaktivovat ostatní komponenty pipeline, aby se trénovala pouze požadovaná komponenta, a (2) převést kontejner Doc tréninkového datového bodu spolu s příslušnými annotations do třídy Example.
V tomto cvičení si oba kroky procvičíš s předem načteným modelem en_core_web_sm, který je dostupný jako nlp. Třída Example je už importovaná a k dispozici máš také řetězec text a související annotations.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Deaktivuj všechny komponenty pipeline modelu
nlpkroměner. - Převeď řetězec
texta jehoannotationsdo správného formátu použitelného pro trénování.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
nlp = spacy.load("en_core_web_sm")
# Disable all pipeline components of except `ner`
other_pipes = [____ for ____ in nlp.____ if ____ != 'ner']
nlp.____(*other_pipes)
# Convert a text and its annotations to the correct format usable for training
doc = nlp.____(text)
example = Example.____(____, ____)
print("Example object for training: \n", example.to_dict())