Prapemrosesan Keras
Modul terpenting kedua dari Keras adalah keras.preprocessing. Anda akan melihat cara menggunakan modul dan fungsi terpenting untuk menyiapkan data mentah agar sesuai dengan bentuk masukan yang benar. Keras menyediakan fungsionalitas yang menggantikan pendekatan kamus yang telah Anda pelajari sebelumnya.
Anda akan menggunakan modul keras.preprocessing.text.Tokenizer untuk membuat kamus kata dengan metode .fit_on_texts() dan mengubah teks menjadi id numerik yang merepresentasikan indeks setiap kata dalam kamus dengan metode .texts_to_sequences().
Selanjutnya, gunakan fungsi .pad_sequences() dari keras.preprocessing.sequence untuk membuat semua urutan memiliki ukuran yang sama (diperlukan untuk model) dengan menambahkan nol pada teks yang pendek dan memotong teks yang panjang.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
- Impor
Tokenizerdanpad_sequencesdari modul yang relevan. - Latih objek
tokenizerpada data contoh yang disimpan dalamtexts. - Ubah teks menjadi urutan indeks numerik menggunakan metode
.texts_to_sequences(). - Samakan ukuran teks dengan melakukan padding.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____
# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)
# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))
# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))