Створення позиційних кодувань
Вкладення (embeddings — векторні представлення) токенів — гарний початок, але цим вкладенням бракує інформації про позицію кожного токена в послідовності. Щоб це виправити, архітектура Transformer використовує позиційні кодування. Вони додають позиційну інформацію з кожного токена до вкладень.
Ви створите клас PositionalEncoding з такими параметрами:
d_model: розмірність вхідних вкладеньmax_seq_length: максимальна довжина послідовності (або довжина послідовності, якщо всі послідовності однакової довжини)
Ця вправа є частиною курсу
Моделі Transformer з PyTorch
Інструкції до вправи
- Створіть матрицю з нулів розміром
max_seq_lengthнаd_model. - Виконайте обчислення sine та cosine для
position * div_term, щоб отримати парні та непарні позиційні значення вкладень. - Переконайтеся, що
peне є навчуваним параметром під час тренування. - Додайте перетворені позиційні вкладення до вхідних вкладень токенів
x.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
class PositionalEncoding(nn.Module):
def __init__(self, d_model, max_seq_length):
super().__init__()
# Create a matrix of zeros of dimensions max_seq_length by d_model
pe = ____
position = torch.arange(0, max_seq_length, dtype=torch.float).unsqueeze(1)
div_term = torch.exp(torch.arange(0, d_model, 2).float() * -(math.log(10000.0) / d_model))
# Perform the sine and cosine calculations
pe[:, 0::2] = torch.____(position * div_term)
pe[:, 1::2] = torch.____(position * div_term)
# Ensure pe isn't a learnable parameter during training
self.____('____', pe.unsqueeze(0))
def forward(self, x):
# Add the positional embeddings to the token embeddings
return ____ + ____[:, :x.size(1)]
pos_encoding_layer = PositionalEncoding(d_model=512, max_seq_length=4)
output = pos_encoding_layer(token_embeddings)
print(output.shape)
print(output[0][0][:10])