Vizualizarea și compararea încorporărilor de cuvinte
Încorporările de cuvinte (embeddings) sunt de înaltă dimensionalitate, ceea ce le face dificil de interpretat direct. În acest exercițiu, vei proiecta câțiva vectori de cuvinte în 2D folosind Analiza Componentelor Principale (PCA) și îi vei vizualiza. Acest lucru ajută la evidențierea grupărilor semantice sau a similarităților dintre cuvinte în spațiul de încorporare. Apoi, vei compara reprezentările de tip embedding ale două modele: glove-wiki-gigaword-50, disponibil prin variabila model_glove_wiki, și glove-twitter-25, disponibil prin model_glove_twitter.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]
# Extract word embeddings
word_vectors = [____[____] for word in words]
# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)
plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()