ÎncepețiÎncepe gratuit

Antrenament cu LoRA

Ai vrut să începi fine-tuning-ul cu RLHF, dar te-ai lovit în mod repetat de erori de memorie insuficientă. Deși ai trecut la încărcarea modelului în precizie de 8 biți, eroarea a persistat. Pentru a rezolva această problemă, ai decis să faci un pas în plus și să aplici LoRA pentru un fine-tuning mai eficient.

Următoarele elemente au fost deja importate:

  • Modelul încărcat în precizie de 8 biți ca pretrained_model_8bit
  • LoraConfig și get_peft_model din peft
  • AutoModelForCausalLMWithValueHead din trl

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează dropout-ul LoRA la 0.1 și tipul de bias la lora-only.
  • Adaugă configurația LoRA la model.
  • Configurează modelul cu un value head pentru antrenamentul PPO.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Editează și rulează codul