Förbehandla data
Du har lärt dig skillnaderna i förbehandling av data vid flerklass-klassificering. Nu är det dags att omsätta det i praktiken genom att förbehandla data inför skapandet av en enkel flerklass-klassificeringsmodell.
Datamängden är inläst i variabeln news_dataset och har följande attribut:
news_dataset.data: array med texternews_dataset.target: array med målkategorier som numeriska index
Exempeldatan innehåller 5 000 observationer.
Den här övningen är en del av kursen
Återkommande neurala nätverk (RNN) för språkmodellering med Keras
Övningsinstruktioner
- Instansiera klassen
Tokenizeri variabelntokenizer. - Anpassa
tokenizer-variabeln på textdatan. - Använd metoden
.texts_to_sequences()på textdatan. - Använd funktionen
to_categorical()för att förbereda målindexen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)