Mulai sekarangMulai gratis

Word2Vec

Pada latihan ini Anda akan membuat model Word2Vec menggunakan Keras.

Korpus yang digunakan untuk pra-pelatihan model adalah naskah semua episode serial TV The Big Bang Theory, yang dibagi per kalimat. Korpus ini tersedia pada variabel bigbang.

Teks pada korpus telah diubah menjadi huruf kecil dan semua kata telah ditokenisasi. Hasilnya disimpan dalam variabel tokenized_corpus.

Sebuah model Word2Vec telah dipra-latih menggunakan ukuran jendela 10 kata untuk konteks (5 sebelum dan 5 setelah kata pusat), kata dengan kemunculan kurang dari 3 dihapus, dan metode skip-gram digunakan dengan dimensi 50. Model disimpan pada berkas bigbang_word2vec.model.

Kelas Word2Vec sudah dimuat di lingkungan dari gensim.models.word2vec.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Muat model Word2Vec yang telah dipra-latih.
  • Simpan sebuah list berisi kata-kata "bazinga", "penny", "universe", "spock", "brain" pada variabel words_of_interest, dengan mempertahankan urutan tersebut.
  • Lakukan iterasi untuk setiap kata yang diminati dengan menggunakan metode .most_similar() pada atribut wv dan tambahkan 5 kata yang paling mirip ke top5_similar_words sebagai sebuah dictionary.
  • Cetak 5 kata teratas yang ditemukan untuk masing-masing kata yang diminati.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Word2Vec model
w2v_model = Word2Vec.load(____)

# Selected words to check similarities
words_of_interest = ____

# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
    top5_similar_words.append(
      {word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
    )

# Print the similar words
____
Edit dan Jalankan Kode