Word2Vec
I den här övningen skapar du en Word2Vec-modell med Keras.
Korpusen som används för att förträna modellen är manuset från alla avsnitt av TV-serien The Big Bang Theory, uppdelat mening för mening. Det finns tillgängligt i variabeln bigbang.
Texten i korpusen har konverterats till gemener och alla ord har tokeniserats. Resultatet lagras i variabeln tokenized_corpus.
En Word2Vec-modell har förträtats med ett fönster på 10 ord för kontext (5 före och 5 efter centerordet), ord med färre än 3 förekomster har tagits bort och skip-gram-metoden har använts med 50 dimensioner. Modellen är sparad i filen bigbang_word2vec.model.
Klassen Word2Vec är redan inläst i miljön från gensim.models.word2vec.
Den här övningen är en del av kursen
Återkommande neurala nätverk (RNN) för språkmodellering med Keras
Övningsinstruktioner
- Läs in den förtränade Word2Vec-modellen.
- Lagra en
listmed orden"bazinga", "penny", "universe", "spock", "brain"i variabelnwords_of_interest, i den ordningen. - Iterera över varje ord av intresse och använd metoden
.most_similar()på attributetwv, och lägg till de 5 mest liknande orden itop5_similar_wordssom en ordbok. - Skriv ut de 5 mest liknande orden för vart och ett av orden av intresse.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Word2Vec model
w2v_model = Word2Vec.load(____)
# Selected words to check similarities
words_of_interest = ____
# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
top5_similar_words.append(
{word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
)
# Print the similar words
____