НачатьНачать бесплатно

Визуализация и сравнение эмбеддингов слов

Эмбеддинги (векторные представления) слов имеют высокую размерность, что затрудняет их непосредственную интерпретацию. В этом упражнении вы спроецируете несколько векторов слов в двумерное пространство с помощью метода главных компонент (PCA) и визуализируете их. Это позволяет выявить семантические группировки и сходства между словами в пространстве эмбеддингов. Затем вы сравните векторные представления двух моделей: glove-wiki-gigaword-50, доступной через переменную model_glove_wiki, и glove-twitter-25, доступной через model_glove_twitter.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
Редактировать и запускать код