Eine Maske für Self-Attention entwerfen
Damit der Decoder lernen kann, Tokens vorherzusagen, ist es wichtig, zukünftige Tokens beim Modellieren der Eingabesequenzen zu maskieren. Du erstellst eine Maske in Form einer dreieckigen Matrix aus True- und False-Werten, mit False-Werten in der oberen Diagonale, um zukünftige Tokens auszuschließen.
Diese Übung ist Teil des Kurses
<Kurs>Transformer-Modelle mit PyTorch</Kurs>Übungsanweisungen
- Erstelle eine boolesche Matrix
tgt_mark, um zukünftige Tokens im Aufmerksamkeitsmechanismus des Decoder-Körpers zu maskieren.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
seq_length= 3
# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
torch.____(1, ____, ____), diagonal=____)
).____()
print(tgt_mask)