Prediksi teks dengan LSTM
Dalam latihan berikut, Anda akan membangun model LSTM sederhana yang mampu memprediksi kata berikutnya menggunakan himpunan data teks kecil.
Himpunan data ini terdiri dari kutipan yang telah dibersihkan dari film The Lord of the Ring. Anda dapat menemukannya dalam variabel text.
Anda akan mengubah text ini menjadi sequences dengan panjang 4 dan menggunakan Tokenizer Keras untuk menyiapkan fitur dan label bagi model Anda!
Tokenizer Keras sudah diimpor untuk Anda gunakan. Tokenizer ini menetapkan nomor unik untuk setiap kata unik, dan menyimpan pemetaannya dalam sebuah dictionary. Hal ini penting karena model bekerja dengan angka, tetapi nantinya kita ingin mengubah kembali output angka menjadi kata.
Latihan ini merupakan bagian dari kursus
Pengantar Deep Learning dengan Keras
Instruksi latihan
- Bagi teks menjadi sebuah array kata menggunakan
.split(). - Bentuk kalimat berisi 4 kata, bergeser satu kata setiap langkah.
- Buat sebuah
Tokenizer(), lalu latih pada kalimat dengan.fit_on_texts(). - Ubah
sentencesmenjadi deret angka dengan memanggil.texts_to_sequences().
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Split text into an array of words
words = ____.____
# Make sentences of 4 words each, moving one word at a time
sentences = []
for i in range(4, len(words)):
sentences.append(' '.join(words[i-____:i]))
# Instantiate a Tokenizer, then fit it on the sentences
tokenizer = ____
tokenizer.____(____)
# Turn sentences into a sequence of numbers
sequences = tokenizer.____(____)
print("Sentences: \n {} \n Sequences: \n {}".format(sentences[:5],sequences[:5]))