CommencezCommencez gratuitement

Contrôler le vocabulaire avec le Tokenizer

Approfondissons un peu le fonctionnement du Tokenizer. Dans cet exercice, vous apprendrez à convertir une phrase quelconque en séquence à l'aide d'un Tokenizer entraîné. De plus, vous verrez comment contrôler la taille du vocabulaire du Tokenizer. Vous examinerez aussi ce qui arrive aux mots hors vocabulaire (OOV) lorsque vous limitez la taille du vocabulaire d'un Tokenizer.

Pour cet exercice, on vous fournit le Tokenizer en_tok que vous avez déjà implémenté. Le Tokenizer a été importé pour vous.

Cette activité fait partie du cours

Traduction automatique avec Keras

Voir le cours

Instructions de l’exercice

  • Convertissez la phrase suivante en séquence en utilisant le Tokenizer en_tok précédent : she likes grapefruit , peaches , and lemons .
  • Créez un nouveau Tokenizer, en_tok_new, avec une taille de vocabulaire de 50 et le mot hors vocabulaire UNK.
  • Ajustez le nouveau tokenizer sur les données en_text.
  • Convertissez la phrase she likes grapefruit , peaches , and lemons . en séquence avec en_tok_new.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Modifier et exécuter le code