Träna med LoRA
Du ville påbörja RLHF-finjustering men stötte hela tiden på minnesbegränsningsfel. Även efter att ha laddat modellen med 8-bitars precision kvarstod felet. För att lösa problemet bestämde du dig för att ta nästa steg och använda LoRA för en mer effektiv finjustering.
Följande har redan importerats:
- Modellen inläst med 8-bitars precision som
pretrained_model_8bit LoraConfigochget_peft_modelfrånpeftAutoModelForCausalLMWithValueHeadfråntrl
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Ange LoRA-dropout till
0.1och biasrtypen till enbart lora. - Lägg till LoRA-konfigurationen i modellen.
- Konfigurera modellen med ett värdehuvud för PPO-träning.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)