Kom igångKom igång gratis

Styra vokabulären med Tokenizer

Nu ska vi titta närmare på hur Tokenizer fungerar. I den här övningen lär du dig att konvertera en godtycklig mening till en sekvens med hjälp av en tränad Tokenizer. Du lär dig också att styra vokabulärstorleken och undersöka vad som händer med ord som faller utanför vokabulären (OOV) när du begränsar storleken på Tokenizer.

I övningen har du tillgång till en_tok – den Tokenizer du implementerade tidigare. Tokenizer har redan importerats åt dig.

Den här övningen är en del av kursen

Maskinöversättning med Keras

Visa kurs

Övningsinstruktioner

  • Konvertera följande mening till en sekvens med den tidigare en_tok Tokenizer: she likes grapefruit , peaches , and lemons .
  • Skapa en ny Tokenizer, en_tok_new, med en vokabulärstorlek på 50 och det okända ordet UNK.
  • Anpassa den nya tokenizern på en_text-data.
  • Konvertera meningen she likes grapefruit , peaches , and lemons . till en sekvens med en_tok_new.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Redigera och kör kod