Antrenament cu LoRA
Ai vrut să începi fine-tuning-ul cu RLHF, dar te-ai lovit în mod repetat de erori de memorie insuficientă. Deși ai trecut la încărcarea modelului în precizie de 8 biți, eroarea a persistat. Pentru a rezolva această problemă, ai decis să faci un pas în plus și să aplici LoRA pentru un fine-tuning mai eficient.
Următoarele elemente au fost deja importate:
- Modelul încărcat în precizie de 8 biți ca
pretrained_model_8bit LoraConfigșiget_peft_modeldinpeftAutoModelForCausalLMWithValueHeaddintrl
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Setează dropout-ul LoRA la
0.1și tipul de bias la lora-only. - Adaugă configurația LoRA la model.
- Configurează modelul cu un value head pentru antrenamentul PPO.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)