Pre-procesarea datelor
Ai învățat care sunt diferențele în pre-procesarea datelor pentru clasificarea multi-clasă. Acum hai să punem în practică aceste cunoștințe, pregătind datele pentru crearea unui model simplu de clasificare multi-clasă.
Setul de date este încărcat în variabila news_dataset și are următoarele atribute:
news_dataset.data: un array cu textelenews_dataset.target: un array cu categoriile țintă sub formă de indecși numerici
Datele exemplu conțin 5.000 de observații.
Acest exercițiu face parte din cursul
Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras
Instrucțiuni pentru exercițiu
- Instanțiază clasa
Tokenizerîn variabilatokenizer. - Antrenează variabila
tokenizerpe datele text. - Folosește metoda
.texts_to_sequences()pe datele text. - Folosește funcția
to_categorical()pentru a pregăti indecșii țintă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)