Zacznij terazZacznij za darmo

Trenowanie z LoRA

Chciałeś rozpocząć dostrajanie RLHF, ale ciągle napotykałeś błędy braku pamięci. Mimo przełączenia na ładowanie modelu z precyzją 8-bitową, problem nadal występował. Postanowiłeś zrobić kolejny krok i zastosować LoRA, aby usprawnić proces dostrajania.

Następujące elementy zostały już zaimportowane:

  • Model załadowany z precyzją 8-bitową jako pretrained_model_8bit
  • LoraConfig i get_peft_model z peft
  • AutoModelForCausalLMWithValueHead z trl

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Ustaw dropout LoRA na 0.1, a typ biasu na lora-only.
  • Dodaj konfigurację LoRA do modelu.
  • Skonfiguruj model z głowicą wartości do treningu PPO.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Edytuj i uruchom kod