Concevoir un masque pour l'auto-attention
Pour que le décodeur puisse apprendre à prédire les jetons, il est essentiel de masquer les jetons futurs lors de la modélisation des séquences d'entrée. Vous allez construire un masque sous forme de matrice triangulaire de valeurs True et False, avec des False sur la diagonale supérieure afin d'exclure les jetons futurs.
Cette activité fait partie du cours
Modèles Transformer avec PyTorch
Instructions de l’exercice
- Créez une matrice booléenne,
tgt_mark, pour masquer les jetons futurs dans le mécanisme d'attention du corps du décodeur.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
seq_length= 3
# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
torch.____(1, ____, ____), diagonal=____)
).____()
print(tgt_mask)