ÎncepețiÎncepe gratuit

Adafactor cu Accelerator

Ai demonstrat un concept de bază al Adafactor cu Trainer pentru a antrena modelul de traducere a limbilor cu cerințe reduse de memorie. Acum vrei să personalizezi bucla de antrenament folosind Accelerator. Construiește bucla de antrenament care să utilizeze Adafactor!

Funcția compute_optimizer_size() a fost predefinită. Câteva obiecte de antrenament au fost preîncărcate: model, train_dataloader și accelerator. Adafactor a fost preimportat din torch.optim.

Acest exercițiu face parte din cursul

Antrenament eficient al modelelor AI cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Transmite parametrii modelului către Adafactor când definești optimizer.
  • Transmite starea optimizatorului pentru a afișa dimensiunea.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Pass the model parameters to Adafactor
optimizer = Adafactor(params=____.____())
model, optimizer, train_dataloader = accelerator.prepare(model, optimizer, train_dataloader)

for batch in train_dataloader:
    inputs, targets = batch["input_ids"], batch["labels"]
    outputs = model(inputs, labels=targets)
    loss = outputs.loss
    accelerator.backward(loss)
    optimizer.step()
    optimizer.zero_grad()

# Pass in the optimizer state
total_size_megabytes, total_num_elements = compute_optimizer_size(optimizer.state.____())
print(f"Number of optimizer parameters: {total_num_elements:,}\nOptimizer size: {total_size_megabytes:.0f} MB")  
Editează și rulează codul