Mulai sekarangMulai gratis

Prediksi teks dengan LSTM

Dalam latihan berikut, Anda akan membangun model LSTM sederhana yang mampu memprediksi kata berikutnya menggunakan himpunan data teks kecil. Himpunan data ini terdiri dari kutipan yang telah dibersihkan dari film The Lord of the Ring. Anda dapat menemukannya dalam variabel text.

Anda akan mengubah text ini menjadi sequences dengan panjang 4 dan menggunakan Tokenizer Keras untuk menyiapkan fitur dan label bagi model Anda!

Tokenizer Keras sudah diimpor untuk Anda gunakan. Tokenizer ini menetapkan nomor unik untuk setiap kata unik, dan menyimpan pemetaannya dalam sebuah dictionary. Hal ini penting karena model bekerja dengan angka, tetapi nantinya kita ingin mengubah kembali output angka menjadi kata.

Latihan ini merupakan bagian dari kursus

Pengantar Deep Learning dengan Keras

Lihat Kursus

Instruksi latihan

  • Bagi teks menjadi sebuah array kata menggunakan .split().
  • Bentuk kalimat berisi 4 kata, bergeser satu kata setiap langkah.
  • Buat sebuah Tokenizer(), lalu latih pada kalimat dengan .fit_on_texts().
  • Ubah sentences menjadi deret angka dengan memanggil .texts_to_sequences().

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Split text into an array of words 
words = ____.____

# Make sentences of 4 words each, moving one word at a time
sentences = []
for i in range(4, len(words)):
  sentences.append(' '.join(words[i-____:i]))

# Instantiate a Tokenizer, then fit it on the sentences
tokenizer = ____
tokenizer.____(____)

# Turn sentences into a sequence of numbers
sequences = tokenizer.____(____)
print("Sentences: \n {} \n Sequences: \n {}".format(sentences[:5],sequences[:5]))
Edit dan Jalankan Kode