ПочатиПочніть безкоштовно

Створення маски для self-attention

Щоб декодер міг навчатися передбачати токени, важливо приховувати майбутні токени під час моделювання вхідних послідовностей. Ви побудуєте маску у вигляді трикутної матриці зі значень True і False, де у верхній діагоналі будуть False, щоб виключити майбутні токени.

Ця вправа є частиною курсу

Моделі Transformer з PyTorch

Переглянути курс

Інструкції до вправи

  • Створіть булеву матрицю tgt_mark, щоб маскувати майбутні токени в механізмі уваги в тілі декодера.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

seq_length= 3

# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
  torch.____(1, ____, ____), diagonal=____)
).____()

print(tgt_mask)
Редагувати та запускати код