Kom igångKom igång gratis

Förbehandla data

Du har lärt dig skillnaderna i förbehandling av data vid flerklass-klassificering. Nu är det dags att omsätta det i praktiken genom att förbehandla data inför skapandet av en enkel flerklass-klassificeringsmodell.

Datamängden är inläst i variabeln news_dataset och har följande attribut:

  • news_dataset.data: array med texter
  • news_dataset.target: array med målkategorier som numeriska index

Exempeldatan innehåller 5 000 observationer.

Den här övningen är en del av kursen

Återkommande neurala nätverk (RNN) för språkmodellering med Keras

Visa kurs

Övningsinstruktioner

  • Instansiera klassen Tokenizer i variabeln tokenizer.
  • Anpassa tokenizer-variabeln på textdatan.
  • Använd metoden .texts_to_sequences() på textdatan.
  • Använd funktionen to_categorical() för att förbereda målindexen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Redigera och kör kod