Bắt đầu ngayBắt đầu miễn phí

Thiết kế mặt nạ cho self-attention

Để bộ giải mã (decoder) học cách dự đoán token, điều quan trọng là phải che (mask) các token ở tương lai khi mô hình hóa chuỗi đầu vào. Bạn sẽ xây dựng một mặt nạ dưới dạng ma trận tam giác gồm các giá trị TrueFalse, với các giá trị False ở phần tam giác trên (phía trên đường chéo) để loại trừ các token tương lai.

Bài tập này là một phần của khóa học

Các mô hình Transformer với PyTorch

Xem khóa học

Hướng dẫn bài tập

  • Tạo một ma trận Boolean, tgt_mark, để che các token ở tương lai trong cơ chế attention của phần thân decoder.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

seq_length= 3

# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
  torch.____(1, ____, ____), diagonal=____)
).____()

print(tgt_mask)
Chỉnh sửa và Chạy Mã