自己注意のためのマスクを設計する
デコーダがトークンを予測できるように学習するには、入力系列をモデル化する際に将来のトークンをマスクすることが重要です。ここでは、True と False からなる三角行列のマスクを作成します。将来のトークンを除外するため、上三角部分を False にします。
この演習はコースの一部です
PyTorchで学ぶTransformerモデル
演習の手順
- デコーダ本体のアテンション機構で将来のトークンをマスクするためのブール行列
tgt_markを作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
seq_length= 3
# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
torch.____(1, ____, ____), diagonal=____)
).____()
print(tgt_mask)