Mulai sekarangMulai gratis

Menyiapkan teks keluaran

Dalam latihan ini, Anda akan menyiapkan teks keluaran yang akan digunakan pada model penerjemahan. Selain mengubah teks menjadi urutan indeks, Anda juga perlu melakukan one-hot encoding pada setiap indeks.

Teks bahasa Inggris dimuat ke variabel en_sentences, tokenizer yang sudah dilatih dimuat ke variabel output_tokenizer, dan ukuran kosakata bahasa Inggris ada pada en_vocab_size.

Selain itu, sebuah fungsi untuk melakukan langkah pertama transformasi bahasa keluaran (mengubah teks menjadi urutan indeks) sudah dibuat. Fungsi tersebut dimuat ke lingkungan sebagai transform_text_to_sequences() dan memiliki dua parameter: sentences yang mengharapkan daftar kalimat dalam bahasa Inggris dan tokenizer yang mengharapkan objek Tokenizer yang sudah dilatih dari modul keras.preprocessing.text.

numpy dimuat sebagai np.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Operkan variabel en_sentences dan output_tokenizer ke fungsi transform_text_to_sequences() untuk menginisialisasi variabel Y.
  • Gunakan fungsi to_categorical() untuk melakukan one-hot encoding pada kalimat. Gunakan variabel en_vocab_size sebagai jumlah kelas.
  • Ubah daftar sementara menjadi array numpy dan ubah bentuknya agar memiliki bentuk (num_sentences, sentences_len, en_vocab_size).
  • Cetak teks mentah dan hasil transformasinya.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Initialize the variable
Y = transform_text_to_sequences(____, ____)

# Temporary list
ylist = list()
for sequence in Y:
  	# One-hot encode sentence and append to list
    ylist.append(____(sequence, num_classes=____))

# Update the variable
Y = np.array(ylist).reshape(____, Y.shape[1], en_vocab_size)

# Print the raw sentence and its transformed version
print("Raw sentence: {0}\nTransformed: {1}".format(____, Y[0]))
Edit dan Jalankan Kode