Contrôler le vocabulaire avec le Tokenizer
Approfondissons un peu le fonctionnement du Tokenizer. Dans cet exercice, vous apprendrez à convertir une phrase quelconque en séquence à l'aide d'un Tokenizer entraîné. De plus, vous verrez comment contrôler la taille du vocabulaire du Tokenizer. Vous examinerez aussi ce qui arrive aux mots hors vocabulaire (OOV) lorsque vous limitez la taille du vocabulaire d'un Tokenizer.
Pour cet exercice, on vous fournit le Tokenizer en_tok que vous avez déjà implémenté. Le Tokenizer a été importé pour vous.
Cette activité fait partie du cours
Traduction automatique avec Keras
Instructions de l’exercice
- Convertissez la phrase suivante en séquence en utilisant le
Tokenizeren_tokprécédent :she likes grapefruit , peaches , and lemons . - Créez un nouveau
Tokenizer,en_tok_new, avec une taille de vocabulaire de 50 et le mot hors vocabulaireUNK. - Ajustez le nouveau tokenizer sur les données
en_text. - Convertissez la phrase
she likes grapefruit , peaches , and lemons .en séquence avecen_tok_new.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])