Implementarea atenției multi-cap
Înainte să începi să construiești propria clasă MultiHeadAttention, vei folosi clasa existentă pentru a vedea cum transformă matricele query, key și value. Reamintește-ți că aceste matrice sunt generate prin proiectarea încorporărilor de intrare cu ajutorul transformărilor liniare cu ponderi învățate.
Matricele query, key și value au fost deja create pentru tine, la fel și clasa MultiHeadAttention.
Acest exercițiu face parte din cursul
Modele Transformer cu PyTorch
Instrucțiuni pentru exercițiu
- Definește parametrii de atenție pentru opt capete de atenție și încorporări de intrare cu o dimensionalitate de
512. - Creează o instanță a clasei
MultiHeadAttentionfolosind parametrii definiți. - Transmite matricele
query,keyșivalueprin mecanismulmultihead_attn.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define attention parameters
d_model = ____
num_heads = ____
# Instantiate a MultiHeadAttention instance
multihead_attn = ____
# Pass the query, key, and value matrices through the mechanism
output = ____
print(output.shape)