Word2Vec
Pada latihan ini Anda akan membuat model Word2Vec menggunakan Keras.
Korpus yang digunakan untuk pra-pelatihan model adalah naskah semua episode serial TV The Big Bang Theory, yang dibagi per kalimat. Korpus ini tersedia pada variabel bigbang.
Teks pada korpus telah diubah menjadi huruf kecil dan semua kata telah ditokenisasi. Hasilnya disimpan dalam variabel tokenized_corpus.
Sebuah model Word2Vec telah dipra-latih menggunakan ukuran jendela 10 kata untuk konteks (5 sebelum dan 5 setelah kata pusat), kata dengan kemunculan kurang dari 3 dihapus, dan metode skip-gram digunakan dengan dimensi 50. Model disimpan pada berkas bigbang_word2vec.model.
Kelas Word2Vec sudah dimuat di lingkungan dari gensim.models.word2vec.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
- Muat model Word2Vec yang telah dipra-latih.
- Simpan sebuah
listberisi kata-kata"bazinga", "penny", "universe", "spock", "brain"pada variabelwords_of_interest, dengan mempertahankan urutan tersebut. - Lakukan iterasi untuk setiap kata yang diminati dengan menggunakan metode
.most_similar()pada atributwvdan tambahkan 5 kata yang paling mirip ketop5_similar_wordssebagai sebuah dictionary. - Cetak 5 kata teratas yang ditemukan untuk masing-masing kata yang diminati.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Word2Vec model
w2v_model = Word2Vec.load(____)
# Selected words to check similarities
words_of_interest = ____
# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
top5_similar_words.append(
{word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
)
# Print the similar words
____