시작하기무료로 시작하기

LoRA로 학습하기

RLHF 미세 조정을 시작하려 했지만 메모리 부족 오류가 계속 발생했어요. 모델을 8비트 정밀도로 로드하도록 바꿨는데도 오류가 사라지지 않았죠. 이를 해결하기 위해 다음 단계로 넘어가, 더 효율적인 미세 조정을 위해 LoRA를 적용하기로 했어요.

다음 항목들은 이미 임포트되어 있어요:

  • 8비트 정밀도로 로드된 모델 pretrained_model_8bit
  • peftLoraConfigget_peft_model
  • trlAutoModelForCausalLMWithValueHead

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • LoRA 드롭아웃을 0.1로 설정하고 bias 타입은 lora-only로 지정하세요.
  • LoRA 설정을 모델에 적용하세요.
  • PPO 학습을 위해 value head가 포함된 모델을 구성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
코드 편집 및 실행