Створення маски для self-attention
Щоб декодер міг навчатися передбачати токени, важливо приховувати майбутні токени під час моделювання вхідних послідовностей. Ви побудуєте маску у вигляді трикутної матриці зі значень True і False, де у верхній діагоналі будуть False, щоб виключити майбутні токени.
Ця вправа є частиною курсу
Моделі Transformer з PyTorch
Інструкції до вправи
- Створіть булеву матрицю
tgt_mark, щоб маскувати майбутні токени в механізмі уваги в тілі декодера.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
seq_length= 3
# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
torch.____(1, ____, ____), diagonal=____)
).____()
print(tgt_mask)