Word2Vec
În acest exercițiu vei crea un model Word2Vec folosind Keras.
Corpusul folosit pentru pre-antrenarea modelului este scenariul tuturor episoadelor serialului The Big Bang Theory, împărțit propoziție cu propoziție. Acesta este disponibil în variabila bigbang.
Textul din corpus a fost transformat în litere mici și toate cuvintele au fost tokenizate. Rezultatul este stocat în variabila tokenized_corpus.
Un model Word2Vec a fost pre-antrenat folosind o fereastră de context de 10 cuvinte (5 înainte și 5 după cuvântul central), cuvintele cu mai puțin de 3 apariții au fost eliminate, iar metoda skip-gram a fost utilizată cu 50 de dimensiuni. Modelul este salvat în fișierul bigbang_word2vec.model.
Clasa Word2Vec este deja încărcată în mediu din gensim.models.word2vec.
Acest exercițiu face parte din cursul
Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras
Instrucțiuni pentru exercițiu
- Încarcă modelul Word2Vec pre-antrenat.
- Stochează o
listcu cuvintele"bazinga", "penny", "universe", "spock", "brain"în variabilawords_of_interest, păstrând ordinea indicată. - Iterează peste fiecare cuvânt de interes, folosind metoda
.most_similar()disponibilă pe atributulwv, și adaugă primele 5 cuvinte similare întop5_similar_wordssub formă de dicționar. - Afișează primele 5 cuvinte găsite pentru fiecare cuvânt de interes.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Word2Vec model
w2v_model = Word2Vec.load(____)
# Selected words to check similarities
words_of_interest = ____
# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
top5_similar_words.append(
{word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
)
# Print the similar words
____