Mulai sekarangMulai gratis

Buat vektor kalimat dan karakter berikutnya

Latihan ini bertujuan untuk menekankan pentingnya penyiapan data. Anda akan menggunakan teks berisi frasa karakter Sheldon dari acara TV The Big Bang Theory sebagai masukan dan akan membuat vektor indeks kalimat dan karakter berikutnya yang diperlukan sebelum membuat model pembangkitan teks.

Teks tersedia dalam variabel sheldon, demikian pula kosakata (karakter) pada variabel vocabulary dan hiperparameter chars_window dan step yang ditetapkan dengan nilai 20 dan 3. Ini berarti urutan 20 karakter akan digunakan untuk memprediksi karakter berikutnya, dan jendelanya akan bergeser 3 karakter pada setiap iterasi.

Selain itu, paket pandas sebagai pd sudah dimuat di lingkungan.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Pisahkan teks berdasarkan jeda baris untuk melakukan perulangan pada kalimat.
  • Lakukan perulangan hingga akhir kalimat dikurangi chars_window.
  • Tambahkan bagian kalimat yang memiliki chars_window karakter ke variabel sentences dan tambahkan karakter berikutnya ke variabel next_chars.
  • Gunakan vektor yang diperoleh untuk membuat pd.DataFrame() dan cetak baris-baris pertamanya.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Edit dan Jalankan Kode