ÎncepețiÎncepe gratuit

Word2Vec

În acest exercițiu vei crea un model Word2Vec folosind Keras.

Corpusul folosit pentru pre-antrenarea modelului este scenariul tuturor episoadelor serialului The Big Bang Theory, împărțit propoziție cu propoziție. Acesta este disponibil în variabila bigbang.

Textul din corpus a fost transformat în litere mici și toate cuvintele au fost tokenizate. Rezultatul este stocat în variabila tokenized_corpus.

Un model Word2Vec a fost pre-antrenat folosind o fereastră de context de 10 cuvinte (5 înainte și 5 după cuvântul central), cuvintele cu mai puțin de 3 apariții au fost eliminate, iar metoda skip-gram a fost utilizată cu 50 de dimensiuni. Modelul este salvat în fișierul bigbang_word2vec.model.

Clasa Word2Vec este deja încărcată în mediu din gensim.models.word2vec.

Acest exercițiu face parte din cursul

Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă modelul Word2Vec pre-antrenat.
  • Stochează o list cu cuvintele "bazinga", "penny", "universe", "spock", "brain" în variabila words_of_interest, păstrând ordinea indicată.
  • Iterează peste fiecare cuvânt de interes, folosind metoda .most_similar() disponibilă pe atributul wv, și adaugă primele 5 cuvinte similare în top5_similar_words sub formă de dicționar.
  • Afișează primele 5 cuvinte găsite pentru fiecare cuvânt de interes.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Word2Vec model
w2v_model = Word2Vec.load(____)

# Selected words to check similarities
words_of_interest = ____

# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
    top5_similar_words.append(
      {word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
    )

# Print the similar words
____
Editează și rulează codul