ÎncepețiÎncepe gratuit

Pre-procesarea datelor

Ai învățat care sunt diferențele în pre-procesarea datelor pentru clasificarea multi-clasă. Acum hai să punem în practică aceste cunoștințe, pregătind datele pentru crearea unui model simplu de clasificare multi-clasă.

Setul de date este încărcat în variabila news_dataset și are următoarele atribute:

  • news_dataset.data: un array cu textele
  • news_dataset.target: un array cu categoriile țintă sub formă de indecși numerici

Datele exemplu conțin 5.000 de observații.

Acest exercițiu face parte din cursul

Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Instanțiază clasa Tokenizer în variabila tokenizer.
  • Antrenează variabila tokenizer pe datele text.
  • Folosește metoda .texts_to_sequences() pe datele text.
  • Folosește funcția to_categorical() pentru a pregăti indecșii țintă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Editează și rulează codul