spaCy-vokabulär
Ordvektorer, eller word embeddings, är numeriska representationer av ord som gör det möjligt för datorer att utföra komplexa uppgifter med textdata. Ordvektorer ingår i många spaCy-modeller, men ett fåtal modeller saknar dem.
I den här övningen får du träna på att komma åt vokabulärinformation i spaCy. Viss metadata om ordvektorer lagras i varje spaCy-modell. Du kan använda den här informationen för att ta reda på mer om vokabulärstorlek, ordvektorernas dimensioner och liknande.
Paketet spaCy är redan importerat. I en spaCy-modells metadata lagras antalet ord som ett element med nyckeln "vectors", och ordvektorernas dimension lagras som ett element med nyckeln "width".
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Ladda in modellen
en_core_web_md. - Skriv ut antalet ord i
en_core_web_md-modellens vokabulär. - Skriv ut dimensionerna för ordvektorerna i
en_core_web_md-modellen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the en_core_web_md model
md_nlp = ____
# Print the number of words in the model's vocabulary
print("Number of words: ", md_nlp.____["vectors"]["vectors"], "\n")
# Print the dimensions of word vectors in en_core_web_md model
print("Dimension of word vectors: ", md_nlp.____["vectors"]["width"])