Kom igångKom igång gratis

Visualisering och jämförelse av ordinbäddningar

Ordinbäddningar är högdimensionella, vilket gör dem svåra att tolka direkt. I den här övningen projicerar du några ordvektorer ned till 2D med hjälp av principalkomponentanalys (PCA) och visualiserar dem. Det hjälper dig att upptäcka semantiska grupperingar och likheter mellan ord i inbäddningsrymden. Sedan jämför du inbäddningsrepresentationerna från två modeller: glove-wiki-gigaword-50, tillgänglig via variabeln model_glove_wiki, och glove-twitter-25, tillgänglig via model_glove_twitter.

Den här övningen är en del av kursen

Natural Language Processing (NLP) i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
Redigera och kör kod