Mulai sekarangMulai gratis

Mentransformasikan teks baru

Dalam latihan ini, Anda akan mentransformasikan teks baru menjadi deret indeks numerik menggunakan dictionary yang telah dibuat sebelumnya.

Ini bermanfaat ketika Anda sudah memiliki model terlatih dan ingin menerapkannya pada himpunan data baru. Langkah prapemrosesan yang dilakukan pada data pelatihan juga harus diterapkan pada teks baru, agar model dapat membuat prediksi/klasifikasi.

Di sini, Anda juga akan menggunakan token khusus '<UKN/>' untuk merepresentasikan kata-kata yang tidak ada dalam kosakata. Biasanya, token khusus ini menempati indeks pertama pada dictionary, yaitu posisi 0.

Variabel word_to_index, index_to_word, dan vocabulary sudah dimuat di lingkungan. Selain itu, variabel yang berisi teks baru juga sudah dimuat sebagai new_text. Teks baru tersebut telah dicetak agar Anda dapat melihatnya.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Lakukan loop melalui list new_text yang berisi kalimat-kalimat.
  • Tetapkan indeks 0 jika kata tidak ditemukan dalam dictionary.
  • Tambahkan kalimat yang sudah berupa indeks ke variabel new_text_split.
  • Konversikan kembali indeks menjadi teks menggunakan dictionary index_to_word.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
    sent_split = []
    for wd in sentence.split(' '):
        index = word_to_index.get(wd, ____)
        sent_split.append(index)
    new_text_split.append(____)

# Print the first sentence's indexes
print(new_text_split[0])

# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))
Edit dan Jalankan Kode