Styra vokabulären med Tokenizer
Nu ska vi titta närmare på hur Tokenizer fungerar. I den här övningen lär du dig att konvertera en godtycklig mening till en sekvens med hjälp av en tränad Tokenizer. Du lär dig också att styra vokabulärstorleken och undersöka vad som händer med ord som faller utanför vokabulären (OOV) när du begränsar storleken på Tokenizer.
I övningen har du tillgång till en_tok – den Tokenizer du implementerade tidigare. Tokenizer har redan importerats åt dig.
Den här övningen är en del av kursen
Maskinöversättning med Keras
Övningsinstruktioner
- Konvertera följande mening till en sekvens med den tidigare
en_tokTokenizer:she likes grapefruit , peaches , and lemons . - Skapa en ny
Tokenizer,en_tok_new, med en vokabulärstorlek på 50 och det okända ordetUNK. - Anpassa den nya tokenizern på
en_text-data. - Konvertera meningen
she likes grapefruit , peaches , and lemons .till en sekvens meden_tok_new.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])