Kom igångKom igång gratis

Träna med LoRA

Du ville påbörja RLHF-finjustering men stötte hela tiden på minnesbegränsningsfel. Även efter att ha laddat modellen med 8-bitars precision kvarstod felet. För att lösa problemet bestämde du dig för att ta nästa steg och använda LoRA för en mer effektiv finjustering.

Följande har redan importerats:

  • Modellen inläst med 8-bitars precision som pretrained_model_8bit
  • LoraConfig och get_peft_model från peft
  • AutoModelForCausalLMWithValueHead från trl

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Ange LoRA-dropout till 0.1 och biasrtypen till enbart lora.
  • Lägg till LoRA-konfigurationen i modellen.
  • Konfigurera modellen med ett värdehuvud för PPO-träning.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Redigera och kör kod