Bắt đầu ngayBắt đầu miễn phí

Huấn luyện với LoRA

Bạn muốn bắt đầu fine-tuning RLHF nhưng liên tục gặp lỗi tràn bộ nhớ (out-of-memory). Dù đã chuyển sang tải mô hình ở độ chính xác 8-bit, lỗi vẫn còn. Để khắc phục, bạn quyết định tiến thêm một bước và áp dụng LoRA để fine-tuning hiệu quả hơn.

Những thành phần sau đã được nhập sẵn:

  • Mô hình tải ở độ chính xác 8-bit dưới tên pretrained_model_8bit
  • LoraConfigget_peft_model từ peft
  • AutoModelForCausalLMWithValueHead từ trl

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Hướng dẫn bài tập

  • Đặt LoRA dropout thành 0.1 và kiểu bias là lora-only.
  • Thêm cấu hình LoRA vào mô hình.
  • Thiết lập mô hình với value head để huấn luyện PPO.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Chỉnh sửa và Chạy Mã