Thiết kế mặt nạ cho self-attention
Để bộ giải mã (decoder) học cách dự đoán token, điều quan trọng là phải che (mask) các token ở tương lai khi mô hình hóa chuỗi đầu vào. Bạn sẽ xây dựng một mặt nạ dưới dạng ma trận tam giác gồm các giá trị True và False, với các giá trị False ở phần tam giác trên (phía trên đường chéo) để loại trừ các token tương lai.
Bài tập này là một phần của khóa học
Các mô hình Transformer với PyTorch
Hướng dẫn bài tập
- Tạo một ma trận Boolean,
tgt_mark, để che các token ở tương lai trong cơ chế attention của phần thân decoder.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
seq_length= 3
# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
torch.____(1, ____, ____), diagonal=____)
).____()
print(tgt_mask)