Trénink s LoRA
Chtěl/a sis začít s RLHF fine-tuningem, ale narážel/a jsi na chyby způsobené nedostatkem paměti. Přepnutí na načítání modelu v 8bitové přesnosti situaci nevyřešilo. Proto jsi se rozhodl/a udělat další krok a použít LoRA pro efektivnější fine-tuning.
Následující položky jsou už předem naimportované:
- Model načtený v 8bitové přesnosti jako
pretrained_model_8bit LoraConfigaget_peft_modelzpeftAutoModelForCausalLMWithValueHeadztrl
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Nastav LoRA dropout na
0.1a typ biasu pouze na LoRA. - Přidej konfiguraci LoRA do modelu.
- Nastav model s value head pro PPO trénink.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)