Začněte nyníZačněte zdarma

Trénink s LoRA

Chtěl/a sis začít s RLHF fine-tuningem, ale narážel/a jsi na chyby způsobené nedostatkem paměti. Přepnutí na načítání modelu v 8bitové přesnosti situaci nevyřešilo. Proto jsi se rozhodl/a udělat další krok a použít LoRA pro efektivnější fine-tuning.

Následující položky jsou už předem naimportované:

  • Model načtený v 8bitové přesnosti jako pretrained_model_8bit
  • LoraConfig a get_peft_model z peft
  • AutoModelForCausalLMWithValueHead z trl

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Nastav LoRA dropout na 0.1 a typ biasu pouze na LoRA.
  • Přidej konfiguraci LoRA do modelu.
  • Nastav model s value head pro PPO trénink.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Upravit a spustit kód