Mulai sekarangMulai gratis

Menyiapkan teks masukan

Anda telah melihat di video cara menyiapkan teks masukan dan keluaran. Latihan ini bertujuan menunjukkan praktik umum, yaitu menggunakan panjang maksimum kalimat untuk melakukan padding pada semuanya, sehingga tidak ada informasi yang hilang.

Karena model RNN memerlukan masukan dengan ukuran yang sama, ini adalah cara untuk memberi padding pada semua kalimat dan hanya menambahkan nol pada kalimat yang lebih pendek, tanpa memotong kalimat yang lebih panjang.

Selain itu, Anda akan menggunakan kata alih-alih karakter untuk merepresentasikan token; ini adalah pendekatan umum untuk model NMT.

Teks bahasa Portugis telah dimuat ke variabel pt_sentences dan sebuah tokenizer yang sudah di-fit ke variabel input_tokenizer.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Gunakan metode .split() pada setiap kalimat untuk memisahkan berdasarkan spasi dan memperoleh jumlah kata dalam kalimat.
  • Gunakan metode .texts_to_sequences() untuk mengubah teks menjadi urutan indeks.
  • Gunakan panjang maksimum kalimat yang diperoleh untuk melakukan padding.
  • Cetak kalimat pertama yang telah ditransformasikan.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Get maximum length of the sentences
pt_length = max([len(sentence.____) for sentence in pt_sentences])

# Transform text to sequence of numerical indexes
X = input_tokenizer.____(pt_sentences)

# Pad the sequences
X = pad_sequences(X, maxlen=____, padding='post')

# Print first sentence
print(pt_sentences[0])

# Print transformed sentence
print(____)
Edit dan Jalankan Kode