Kom igångKom igång gratis

Word2Vec

I den här övningen skapar du en Word2Vec-modell med Keras.

Korpusen som används för att förträna modellen är manuset från alla avsnitt av TV-serien The Big Bang Theory, uppdelat mening för mening. Det finns tillgängligt i variabeln bigbang.

Texten i korpusen har konverterats till gemener och alla ord har tokeniserats. Resultatet lagras i variabeln tokenized_corpus.

En Word2Vec-modell har förträtats med ett fönster på 10 ord för kontext (5 före och 5 efter centerordet), ord med färre än 3 förekomster har tagits bort och skip-gram-metoden har använts med 50 dimensioner. Modellen är sparad i filen bigbang_word2vec.model.

Klassen Word2Vec är redan inläst i miljön från gensim.models.word2vec.

Den här övningen är en del av kursen

Återkommande neurala nätverk (RNN) för språkmodellering med Keras

Visa kurs

Övningsinstruktioner

  • Läs in den förtränade Word2Vec-modellen.
  • Lagra en list med orden "bazinga", "penny", "universe", "spock", "brain" i variabeln words_of_interest, i den ordningen.
  • Iterera över varje ord av intresse och använd metoden .most_similar() på attributet wv, och lägg till de 5 mest liknande orden i top5_similar_words som en ordbok.
  • Skriv ut de 5 mest liknande orden för vart och ett av orden av intresse.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Word2Vec model
w2v_model = Word2Vec.load(____)

# Selected words to check similarities
words_of_interest = ____

# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
    top5_similar_words.append(
      {word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
    )

# Print the similar words
____
Redigera och kör kod