Praproses data
Anda telah mempelajari perbedaan prapemrosesan data untuk kasus klasifikasi multi-kelas. Mari kita praktikkan dengan menyiapkan data untuk membuat model klasifikasi multi-kelas sederhana.
Himpunan data dimuat ke dalam variabel news_dataset, dan memiliki atribut berikut:
news_dataset.data: array berisi teksnews_dataset.target: array berisi kategori target sebagai indeks numerik
Data contoh berisi 5.000 observasi.
Latihan ini merupakan bagian dari kursus
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
Instruksi latihan
- Instansiasikan kelas
Tokenizerpada variabeltokenizer. - Fit variabel
tokenizerpada data teks. - Gunakan metode
.texts_to_sequences()pada data teks. - Gunakan fungsi
to_categorical()untuk menyiapkan indeks target.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)