CommencezCommencez gratuitement

Mesurer la similarité entre vecteurs de mots

Dans cette leçon, vous allez découvrir la puissance des vecteurs de mots en utilisant des vecteurs entraînés sur des données réelles. Il s'agit de vecteurs tirés d'une liste publiée par le Stanford NLP group. Un vecteur de mots est une suite, ou un vecteur, de valeurs numériques. Par exemple, dog = (0.31, 0.92, 0.13)

La distance entre des vecteurs de mots peut être mesurée à l'aide d'une mesure de similarité par paires. Ici, nous utiliserons sklearn.metrics.pairwise.cosine_similarity. La similarité cosinus donne une valeur plus élevée lorsque la similarité élément par élément de deux vecteurs est grande, et l'inverse lorsqu'elle est faible.

Cette activité fait partie du cours

Traduction automatique avec Keras

Voir le cours

Instructions de l’exercice

  • Affichez la longueur de cat_vector en utilisant l'attribut ndarray.size.
  • Calculez et affichez la similarité entre cat_vector et window_vector avec cosine_similarity.
  • Calculez et affichez la similarité entre cat_vector et dog_vector avec cosine_similarity.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.metrics.pairwise import cosine_similarity

# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)

# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)

# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))
Modifier et exécuter le code