Mentransformasikan teks baru
Dalam latihan ini, Anda akan mentransformasikan teks baru menjadi deret indeks numerik menggunakan dictionary yang telah dibuat sebelumnya.
Ini bermanfaat ketika Anda sudah memiliki model terlatih dan ingin menerapkannya pada himpunan data baru. Langkah prapemrosesan yang dilakukan pada data pelatihan juga harus diterapkan pada teks baru, agar model dapat membuat prediksi/klasifikasi.
Di sini, Anda juga akan menggunakan token khusus '<UKN/>' untuk merepresentasikan kata-kata yang tidak ada dalam kosakata. Biasanya, token khusus ini menempati indeks pertama pada dictionary, yaitu posisi 0.
Variabel word_to_index, index_to_word, dan vocabulary sudah dimuat di lingkungan. Selain itu, variabel yang berisi teks baru juga sudah dimuat sebagai new_text. Teks baru tersebut telah dicetak agar Anda dapat melihatnya.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
- Lakukan loop melalui list
new_textyang berisi kalimat-kalimat. - Tetapkan indeks
0jika kata tidak ditemukan dalam dictionary. - Tambahkan kalimat yang sudah berupa indeks ke variabel
new_text_split. - Konversikan kembali indeks menjadi teks menggunakan dictionary
index_to_word.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))