음의 KL 발산 완화하기
RLHF 기법으로 모델을 미세 조정하던 중, 베이스 모델과 비교해 성능이 떨어진 것을 확인했어요. 음의 KL 발산이 원인이라고 판단되어, 이 문제를 방지할 수 있도록 적절한 생성 파라미터를 설정하려고 합니다.
tokenizer는 미리 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Reinforcement Learning from Human Feedback (RLHF)
연습 안내
- KL 발산을 피할 수 있도록
top_k와min_length값을 설정하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}