Buat vektor kalimat dan karakter berikutnya
Latihan ini bertujuan untuk menekankan pentingnya penyiapan data. Anda akan menggunakan teks berisi frasa karakter Sheldon dari acara TV The Big Bang Theory sebagai masukan dan akan membuat vektor indeks kalimat dan karakter berikutnya yang diperlukan sebelum membuat model pembangkitan teks.
Teks tersedia dalam variabel sheldon, demikian pula kosakata (karakter) pada variabel vocabulary dan hiperparameter chars_window dan step yang ditetapkan dengan nilai 20 dan 3. Ini berarti urutan 20 karakter akan digunakan untuk memprediksi karakter berikutnya, dan jendelanya akan bergeser 3 karakter pada setiap iterasi.
Selain itu, paket pandas sebagai pd sudah dimuat di lingkungan.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
- Pisahkan teks berdasarkan jeda baris untuk melakukan perulangan pada kalimat.
- Lakukan perulangan hingga akhir kalimat dikurangi
chars_window. - Tambahkan bagian kalimat yang memiliki
chars_windowkarakter ke variabelsentencesdan tambahkan karakter berikutnya ke variabelnext_chars. - Gunakan vektor yang diperoleh untuk membuat
pd.DataFrame()dan cetak baris-baris pertamanya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
# Get 20 previous chars and next char; then shift by step
for i in range(0, len(sentence) - ____, step):
sentences.append(sentence[i:i + ____])
next_chars.append(sentence[____ + chars_window])
# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})
# Print the initial rows
print(df.head())