Vecteurs de mots dans le vocabulaire de spaCy
L'objectif des vecteurs de mots est de permettre à un ordinateur de comprendre les mots. Dans cet exercice, vous allez vous exercer à extraire les vecteurs de mots pour une liste donnée de mots.
Une liste de mots est définie dans words. Le modèle en_core_web_md est déjà importé et accessible sous le nom nlp.
Le vocabulaire du modèle en_core_web_md contient 20 000 mots. Si un mot n'existe pas dans le vocabulaire, vous ne pourrez pas en extraire le vecteur correspondant. Dans cet exercice, pour simplifier, on s'assure que tous les mots fournis existent dans le vocabulaire de ce modèle.
Cette activité fait partie du cours
Traitement du langage naturel avec spaCy
Instructions de l’exercice
- Extrayez les identifiants (IDs) de tous les
wordsfournis et enregistrez-les dans une listeids. - Pour chaque ID de
ids, stockez les dix premiers éléments du vecteur de mot dans la listeword_vectors. - Affichez les dix premiers éléments du premier vecteur de mot de
word_vectors.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
words = ["like", "love"]
# IDs of all the given words
ids = [nlp.____.____[w] for w in words]
# Store the first ten elements of the word vectors for each word
word_vectors = [nlp.____.____[i][:10] for i in ids]
# Print the first ten elements of the first word vector
print(____[0])