Mulai sekarangMulai gratis

Prapemrosesan Keras

Modul terpenting kedua dari Keras adalah keras.preprocessing. Anda akan melihat cara menggunakan modul dan fungsi terpenting untuk menyiapkan data mentah agar sesuai dengan bentuk masukan yang benar. Keras menyediakan fungsionalitas yang menggantikan pendekatan kamus yang telah Anda pelajari sebelumnya.

Anda akan menggunakan modul keras.preprocessing.text.Tokenizer untuk membuat kamus kata dengan metode .fit_on_texts() dan mengubah teks menjadi id numerik yang merepresentasikan indeks setiap kata dalam kamus dengan metode .texts_to_sequences().

Selanjutnya, gunakan fungsi .pad_sequences() dari keras.preprocessing.sequence untuk membuat semua urutan memiliki ukuran yang sama (diperlukan untuk model) dengan menambahkan nol pada teks yang pendek dan memotong teks yang panjang.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Impor Tokenizer dan pad_sequences dari modul yang relevan.
  • Latih objek tokenizer pada data contoh yang disimpan dalam texts.
  • Ubah teks menjadi urutan indeks numerik menggunakan metode .texts_to_sequences().
  • Samakan ukuran teks dengan melakukan padding.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____

# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)

# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))

# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))
Edit dan Jalankan Kode