시작하기무료로 시작하기

음의 KL 발산 완화하기

RLHF 기법으로 모델을 미세 조정하던 중, 베이스 모델과 비교해 성능이 떨어진 것을 확인했어요. 음의 KL 발산이 원인이라고 판단되어, 이 문제를 방지할 수 있도록 적절한 생성 파라미터를 설정하려고 합니다.

tokenizer는 미리 임포트되어 있습니다.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • KL 발산을 피할 수 있도록 top_kmin_length 값을 설정하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
코드 편집 및 실행