Word2Vec
V tomto cvičení vytvoříš model Word2Vec pomocí Keras.
Korpus použitý k předtrénování modelu tvoří scénáře všech epizod seriálu Teorie velkého třesku, rozdělené po jednotlivých větách. Je dostupný v proměnné bigbang.
Text v korpusu byl převeden na malá písmena a všechna slova byla tokenizována. Výsledek je uložen v proměnné tokenized_corpus.
Model Word2Vec byl předtrénován s velikostí kontextového okna 10 slov (5 před středovým slovem a 5 za ním), slova s méně než 3 výskyty byla odstraněna a jako metoda byl použit model skip-gram s 50 dimenzemi. Model je uložen v souboru bigbang_word2vec.model.
Třída Word2Vec je v prostředí již načtena z gensim.models.word2vec.
Toto cvičení je součástí kurzu
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
Pokyny k cvičení
- Načti předtrénovaný model Word2Vec.
- Ulož do proměnné
words_of_interestseznamlistse slovy"bazinga", "penny", "universe", "spock", "brain"— zachovej je v tomto pořadí. - Iteruj přes každé slovo ze seznamu, použij metodu
.most_similar()dostupnou na atributuwva přidej 5 nejpodobnějších slov dotop5_similar_wordsjako slovník. - Vypiš nalezených 5 nejpodobnějších slov pro každé slovo ze seznamu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Word2Vec model
w2v_model = Word2Vec.load(____)
# Selected words to check similarities
words_of_interest = ____
# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
top5_similar_words.append(
{word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
)
# Print the similar words
____