Mulai sekarangMulai gratis

Praproses data

Anda telah mempelajari perbedaan prapemrosesan data untuk kasus klasifikasi multi-kelas. Mari kita praktikkan dengan menyiapkan data untuk membuat model klasifikasi multi-kelas sederhana.

Himpunan data dimuat ke dalam variabel news_dataset, dan memiliki atribut berikut:

  • news_dataset.data: array berisi teks
  • news_dataset.target: array berisi kategori target sebagai indeks numerik

Data contoh berisi 5.000 observasi.

Latihan ini merupakan bagian dari kursus

Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras

Lihat Kursus

Instruksi latihan

  • Instansiasikan kelas Tokenizer pada variabel tokenizer.
  • Fit variabel tokenizer pada data teks.
  • Gunakan metode .texts_to_sequences() pada data teks.
  • Gunakan fungsi to_categorical() untuk menyiapkan indeks target.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Edit dan Jalankan Kode