Huấn luyện với LoRA
Bạn muốn bắt đầu fine-tuning RLHF nhưng liên tục gặp lỗi tràn bộ nhớ (out-of-memory). Dù đã chuyển sang tải mô hình ở độ chính xác 8-bit, lỗi vẫn còn. Để khắc phục, bạn quyết định tiến thêm một bước và áp dụng LoRA để fine-tuning hiệu quả hơn.
Những thành phần sau đã được nhập sẵn:
- Mô hình tải ở độ chính xác 8-bit dưới tên
pretrained_model_8bit LoraConfigvàget_peft_modeltừpeftAutoModelForCausalLMWithValueHeadtừtrl
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Đặt LoRA dropout thành
0.1và kiểu bias là lora-only. - Thêm cấu hình LoRA vào mô hình.
- Thiết lập mô hình với value head để huấn luyện PPO.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)