ÎncepețiÎncepe gratuit

Vizualizarea și compararea încorporărilor de cuvinte

Încorporările de cuvinte (embeddings) sunt de înaltă dimensionalitate, ceea ce le face dificil de interpretat direct. În acest exercițiu, vei proiecta câțiva vectori de cuvinte în 2D folosind Analiza Componentelor Principale (PCA) și îi vei vizualiza. Acest lucru ajută la evidențierea grupărilor semantice sau a similarităților dintre cuvinte în spațiul de încorporare. Apoi, vei compara reprezentările de tip embedding ale două modele: glove-wiki-gigaword-50, disponibil prin variabila model_glove_wiki, și glove-twitter-25, disponibil prin model_glove_twitter.

Acest exercițiu face parte din cursul

Procesarea Limbajului Natural (NLP) în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
Editează și rulează codul