Trenowanie z LoRA
Chciałeś rozpocząć dostrajanie RLHF, ale ciągle napotykałeś błędy braku pamięci. Mimo przełączenia na ładowanie modelu z precyzją 8-bitową, problem nadal występował. Postanowiłeś zrobić kolejny krok i zastosować LoRA, aby usprawnić proces dostrajania.
Następujące elementy zostały już zaimportowane:
- Model załadowany z precyzją 8-bitową jako
pretrained_model_8bit LoraConfigiget_peft_modelzpeftAutoModelForCausalLMWithValueHeadztrl
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Ustaw dropout LoRA na
0.1, a typ biasu na lora-only. - Dodaj konfigurację LoRA do modelu.
- Skonfiguruj model z głowicą wartości do treningu PPO.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)