Slovník spaCy
Slovní vektory, neboli word embeddings, jsou číselné reprezentace slov, které počítačům umožňují provádět složité úlohy s textovými daty. Slovní vektory jsou součástí mnoha modelů spaCy, některé modely je však neobsahují.
V tomto cvičení si procvičíš přístup k informacím o slovníku spaCy. Část metadat o slovních vektorech je uložena v každém modelu spaCy. Tato data ti umožní zjistit více o velikosti slovníku, dimenzích slovních vektorů a podobně.
Balíček spaCy je již naimportován. V metadatech modelu spaCy je počet slov uložen jako prvek s klíčem "vectors" a dimenze slovních vektorů jako prvek s klíčem "width".
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Načti model
en_core_web_md. - Vypiš počet slov ve slovníku modelu
en_core_web_md. - Vypiš dimenze slovních vektorů modelu
en_core_web_md.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the en_core_web_md model
md_nlp = ____
# Print the number of words in the model's vocabulary
print("Number of words: ", md_nlp.____["vectors"]["vectors"], "\n")
# Print the dimensions of word vectors in en_core_web_md model
print("Dimension of word vectors: ", md_nlp.____["vectors"]["width"])