始める無料で始める

自己注意のためのマスクを設計する

デコーダがトークンを予測できるように学習するには、入力系列をモデル化する際に将来のトークンをマスクすることが重要です。ここでは、TrueFalse からなる三角行列のマスクを作成します。将来のトークンを除外するため、上三角部分を False にします。

この演習はコースの一部です

PyTorchで学ぶTransformerモデル

コースを見る

演習の手順

  • デコーダ本体のアテンション機構で将来のトークンをマスクするためのブール行列 tgt_mark を作成してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

seq_length= 3

# Create a Boolean matrix to mask future tokens
tgt_mask = (1 - torch.____(
  torch.____(1, ____, ____), diagonal=____)
).____()

print(tgt_mask)
コードを編集して実行