CommencezCommencez gratuitement

Concevoir un masque pour l'auto-attention

Pour que le décodeur puisse apprendre à prédire les jetons, il est essentiel de masquer les jetons futurs lors de la modélisation des séquences d'entrée. Vous allez construire un masque sous forme de matrice triangulaire de valeurs True et False, avec des False sur la diagonale supérieure afin d'exclure les jetons futurs.

Cette activité fait partie du cours

Modèles Transformer avec PyTorch

Voir le cours

Instructions de l’exercice

  • Créez une matrice booléenne, tgt_mark, pour masquer les jetons futurs dans le mécanisme d'attention du corps du décodeur.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

seq_length= 3

# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
  torch.____(1, ____, ____), diagonal=____)
).____()

print(tgt_mask)
Modifier et exécuter le code