可視化並比較詞嵌入向量
詞嵌入向量維度很高,直接解讀並不容易。這個練習中,你會用主成分分析(PCA)把幾個詞向量降到 2D,並將它們視覺化。這能幫你觀察在嵌入空間中,詞與詞之間的語意分群或相似性。接著,你會比較兩個模型的嵌入表示法:「glove-wiki-gigaword-50」(變數 model_glove_wiki)以及「glove-twitter-25」(變數 model_glove_twitter)。
本練習屬於課程
Python 的 Natural Language Processing(NLP)
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]
# Extract word embeddings
word_vectors = [____[____] for word in words]
# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)
plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()