CommencezCommencez gratuitement

Préparer le texte d'entrée

Vous avez vu dans la vidéo comment préparer les textes d'entrée et de sortie. Cet exercice illustre une pratique courante : utiliser la longueur maximale des phrases pour les remplir (padding), afin qu'aucune information ne soit perdue.

Comme les modèles RNN exigent des entrées de même taille, on remplit ainsi toutes les phrases en ajoutant des zéros aux plus courtes, sans couper les plus longues.

De plus, vous utiliserez des mots plutôt que des caractères pour représenter les jetons, une approche fréquente pour les modèles de NMT.

Les textes en portugais sont chargés dans la variable pt_sentences et un tokenizer déjà ajusté se trouve dans la variable input_tokenizer.

Cette activité fait partie du cours

Réseaux de neurones récurrents (RNN) pour la modélisation du langage avec Keras

Voir le cours

Instructions de l’exercice

  • Utilisez la méthode .split() sur chaque phrase pour séparer selon l'espace blanc et obtenir le nombre de mots de la phrase.
  • Utilisez la méthode .texts_to_sequences() pour transformer le texte en une séquence d'indices.
  • Utilisez la longueur maximale des phrases obtenue pour les remplir (padding).
  • Affichez la première phrase transformée.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get maximum length of the sentences
pt_length = max([len(sentence.____) for sentence in pt_sentences])

# Transform text to sequence of numerical indexes
X = input_tokenizer.____(pt_sentences)

# Pad the sequences
X = pad_sequences(X, maxlen=____, padding='post')

# Print first sentence
print(pt_sentences[0])

# Print transformed sentence
print(____)
Modifier et exécuter le code