ПочатиПочніть безкоштовно

Візуалізація та порівняння вкладень слів

Вкладення (embeddings — векторні представлення) мають велику розмірність, тож їх складно інтерпретувати безпосередньо. У цій вправі ви спроєктуєте кілька векторів слів у 2D за допомогою методу головних компонент (PCA) і візуалізуєте їх. Це допоможе виявити семантичні групування або подібності між словами в просторі вкладень. Далі ви порівняєте векторні представлення двох моделей: glove-wiki-gigaword-50, доступної через змінну model_glove_wiki, і glove-twitter-25, доступної через model_glove_twitter.

Ця вправа є частиною курсу

Natural Language Processing (NLP) in Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
Редагувати та запускати код