CommencezCommencez gratuitement

Implémenter l'attention multi-tête

Avant de vous lancer dans la création de votre propre classe MultiHeadAttention, essayez d'utiliser la classe pour voir comment elle transforme les matrices query, key et value. Rappelez-vous que ces matrices sont générées en projetant les plongements d'entrée au moyen de transformations linéaires avec des poids appris.

Les matrices query, key et value ont déjà été créées pour vous, et MultiHeadAttention a été défini pour vous.

Cette activité fait partie du cours

Modèles Transformer avec PyTorch

Voir le cours

Instructions de l’exercice

  • Définissez les paramètres d'attention pour huit têtes d'attention et des plongements d'entrée de dimension 512.
  • Créez une instance de la classe MultiHeadAttention en utilisant les paramètres définis.
  • Faites passer les matrices query, key et value dans le mécanisme multihead_attn.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define attention parameters
d_model = ____
num_heads = ____

# Instantiate a MultiHeadAttention instance
multihead_attn = ____

# Pass the query, key, and value matrices through the mechanism
output = ____
print(output.shape)
Modifier et exécuter le code