CommencezCommencez gratuitement

Visualiser et comparer des plongements de mots

Les plongements de mots sont de grande dimension, ce qui les rend difficiles à interpréter directement. Dans cet exercice, vous allez projeter quelques vecteurs de mots en 2D à l'aide de l'analyse en composantes principales (PCA) et les visualiser. Cela aide à révéler des regroupements sémantiques ou des similarités entre les mots dans l'espace des plongements. Ensuite, vous comparerez les représentations de plongements de deux modèles : glove-wiki-gigaword-50, accessible via la variable model_glove_wiki, et glove-twitter-25, accessible via model_glove_twitter.

Cette activité fait partie du cours

Natural Language Processing (NLP) en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
Modifier et exécuter le code