Kom igångKom igång gratis

Förbearbetning i Keras

Den näst viktigaste modulen i Keras är keras.preprocessing. Du får se hur du använder de viktigaste modulerna och funktionerna för att förbereda rådata till rätt indataformat. Keras erbjuder funktioner som ersätter den ordlistebaserade metod du lärde dig tidigare.

Du använder modulen keras.preprocessing.text.Tokenizer för att skapa en ordlista med metoden .fit_on_texts() och omvandlar sedan texterna till numeriska id:n som representerar indexet för varje ord i ordlistan med hjälp av metoden .texts_to_sequences().

Använd sedan funktionen .pad_sequences() från keras.preprocessing.sequence för att ge alla sekvenser samma längd – vilket krävs av modellen – genom att lägga till nollor i korta texter och trimma de långa.

Den här övningen är en del av kursen

Återkommande neurala nätverk (RNN) för språkmodellering med Keras

Visa kurs

Övningsinstruktioner

  • Importera Tokenizer och pad_sequences från relevanta moduler.
  • Anpassa tokenizer-objektet till exempeldata som finns lagrad i texts.
  • Omvandla texterna till sekvenser av numeriska index med metoden .texts_to_sequences().
  • Justera texternas längd genom att padda dem.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____

# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)

# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))

# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))
Redigera och kör kod